Иерархический байесовский подход
[21/0%]Для модели (3.3.1) пусть — байесовское апостериорное распределение при фиксированном априорном распределении, а — иерархическое байесовское апостериорное распределение. Покажите, что , где .
Для ситуации задачи 5.1 покажите, что:
;
;
и, следовательно, что будет, как правило, иметь бо́льшую дисперсию, чем .
Для модели (3.3.3) покажите, что:
Маргинальное априорное распределение , безусловное относительно , задаётся формулой
которое при и является -распределением Стьюдента с степенями свободы.
Маргинальное апостериорное распределение задаётся формулой
Albert and Gupta (1985) исследуют теорию и приложения иерархической модели
Покажите, что
[Заметим, что и не выражаются в простом виде.]
Безусловно по , величины имеют условную ковариацию
Игнорируя априорное распределение , покажите, как построить эмпирическую байесовскую оценку . (Опять же, она не выражается в простом виде.)
[Albert and Gupta (1985) на самом деле рассматривают более общую модель, чем приведённая здесь, и показывают, как приближённо получить байесовское решение. Они применяют свою модель к задаче об отсутствии ответов при почтовых опросах.]
По аналогии с задачей 1.7.9 докажите, что для любых случайных величин и ,
Для иерархии
покажите, что .
Если , где и известны, то
[Пункт (c) указывает на определённое ограничение применимости некоторых иерархических моделей, а именно на то, что они влекут положительную корреляционную структуру в апостериорном распределении.]
Модель однофакторных случайных эффектов из примера 2.7 (см. также примеры 3.5.1 и 3.5.5) можно записать в виде иерархической модели
Если, кроме того, положить равномерное , покажите, что байесовская оценка при квадратичной функции потерь задаётся формулой (3.5.13) — UMVU-предиктором .
Обращаясь к примеру 6.6:
Используя априорное распределение для , заданное в (5.6.27), покажите, что мода апостериорного распределения равна , и, следовательно, эмпирическая байесовская оценка, основанная на этом , не совпадает с иерархической байесовской оценкой (5.6.29).
Покажите, что если оценивать с помощью его апостериорного математического ожидания , то получаемая эмпирическая байесовская оценка совпадает с иерархической байесовской оценкой.
Метод интегрирования Монте-Карло позволяет вычислять (возможно, сложные) интегралы с помощью (возможно, простой) генерации случайных величин.
Чтобы вычислить , сгенерируйте выборку , независимую одинаково распределённую, из . Тогда при .
Если трудно сгенерировать случайную величину из , то сгенерируйте пары случайных величин
Тогда при . [Покажите, что если генерируется согласно и , то .]
Если сгенерировать, как в пункте (b), затруднительно, то сгенерируйте
для и .
Покажите, что:
-
для каждого последовательность является цепью Маркова. Если это к тому же эргодическая цепь Маркова, то при , где имеет стационарное распределение цепи.
-
Если стационарное распределение цепи равно , то
при .
Это основная теория, лежащая в основе сэмплера Гиббса. Для каждого мы сгенерировали независимые случайные величины , где распределена согласно . Также верно, что для каждого и большого величина распределена приближённо согласно , хотя эти величины уже не являются независимыми. Преимущества и недостатки этих вычислительных схем (одна длинная цепь против многих коротких цепей) обсуждаются в Gelman and Rubin 1992; см. также Geyer and Thompson 1992 и Smith and Roberts 1992. Преобладающее мнение склоняется в пользу одной длинной цепи.
Чтобы понять сходимость сэмплера Гиббса, пусть , и определим
Покажите, что функция , решающая уравнение , есть — маргинальное распределение .
Запишите аналогичное интегральное уравнение, которому удовлетворяет .
Определите последовательность функций рекуррентно как , где произвольна, но удовлетворяет . Покажите, что
и, следовательно, сходится к .
[Метод пункта (c) называется методом последовательных подстановок. Когда в сэмплере Гиббса участвуют две переменные, он эквивалентен аугментации данных (Tanner and Wong 1987). Даже если переменные векторнозначны, приведённые выше результаты устанавливают сходимость. Если исходный вектор переменных содержит более двух переменных, то требуется более общая версия этого рассуждения (Gelfand and Smith 1990).]
Прямая реализация подстановочной выборки методом Монте-Карло обеспечивается алгоритмом аугментации данных (Tanner and Wong 1987). Если определить
то по задаче 5.9 при .
Чтобы вычислить методом интегрирования Монте-Карло:
-
Сгенерируйте .
-
Для каждого сгенерируйте .
-
Вычислите . Тогда при , и, следовательно, алгоритм аугментации данных сходится.
Чтобы реализовать (a)(i), нужно уметь генерировать случайную величину из смеси распределений. Покажите, что если , то алгоритм
-
Выбрать с вероятностью
-
Сгенерировать порождает случайную величину с распределением .
Отсюда покажите, как реализовать шаг (a)(i), генерируя случайные величины из . Tanner and Wong (1987) отмечают, что этот алгоритм работает даже при , что даёт приближение
идентичное сэмплеру Гиббса. Алгоритм аугментации данных можно также рассматривать как применение процедуры множественной импутации (multiple imputation) (Rubin 1976, 1987, Little and Rubin 1987).
Выборку методом последовательных подстановок можно реализовать через сэмплер Гиббса следующим образом. Из задачи 5.8(c) требуется вычислить
Покажите, что при .
При заданном приближение Монте-Карло к имеет вид
где и при .
Следовательно, при .
Это сэмплер Гиббса, который обычно реализуется при .
Для ситуации примера 5.6 покажите, что
Обсудите, когда в (b) может достигаться равенство. Можете ли вы привести пример?
Покажите, что для иерархии (5.5.1) апостериорные распределения и удовлетворяют
и, следовательно, являются стационарными точками цепей Маркова в (5.5.13).
Исходя из равномерной случайной величины , с помощью преобразований можно построить многие случайные величины.
Покажите, что .
Покажите, что , где — независимые одинаково распределённые как .
Пусть . Запишите как функцию от .
Пусть , — целое число. Запишите как функцию от , независимых одинаково распределённых как .
Начиная со случайной величины , преобразования из задачи 5.14 не позволяют получить нормальные случайные величины или гамма-случайные величины с нецелым параметром формы. Один из способов сделать это — использовать алгоритм принятия-отклонения (Accept-Reject Algorithm) (Ripley 1987, раздел 3.2), алгоритм для моделирования :
-
Сгенерировать , независимо.
-
Вычислить где .
-
Если , положить , иначе вернуться к i).
Покажите, что этот алгоритм генерирует .
Начиная с , покажите, как сгенерировать .
Покажите, как сгенерировать гамма-случайную величину с нецелым параметром формы.
Рассмотрим нормальную иерархическую модель
где , известны.
Покажите, что апостериорное распределение равно
где и .
Найдите выражение для информации Кульбака—Лейблера и покажите, что она является убывающей функцией .
В первоначальном доказательстве теоремы 5.7 (Goel and DeGroot 1981) использовалась энтропийная функция Реньи (Rényi 1961)
где и — плотности, — доминирующая мера, а — постоянная, .
Покажите, что удовлетворяет и .
Покажите, что теорема 5.7 остаётся верной, если вместо использовать .
Покажите, что , и приведите другое доказательство теоремы 5.7.
Информация Кульбака—Лейблера (5.5.25) не симметрична по и , и модификация, называемая дивергенцией, устраняет эту асимметрию. Определим — дивергенцию между и — как . Покажите, что, аналогично теореме 5.7, .
Goel and DeGroot (1981) определяют байесовский аналог информации Фишера [см. (2.5.10)] как
— информацию, которую несёт об апостериорном распределении. Как и в теореме 5.7, покажите, что , что снова показывает, что влияние меньше влияния .
Каждая из спор имеет вероятность прорастания. Из проросших спор каждая имеет вероятность изогнуться в определённом направлении. Если изгибается в этом определённом направлении, то вероятностная модель, описывающая этот процесс, — двумерное биномиальное распределение с функцией вероятности
Покажите, что априорное распределение Джеффриса равно .
Если рассматривается как мешающий параметр, то референсное априорное распределение равно
Сравните апостериорные средние при априорном распределении Джеффриса и при референсном априорном распределении. Является ли одно из них более подходящим?
Как разные априорные распределения влияют на апостериорную дисперсию?
[Априорные распределения для двумерного биномиального распределения рассматривались в работах Crowder and Sweeting (1989), Polson and Wasserman (1990) и Clark and Wasserman (1993), которые предлагают компромиссное референсное/джеффрисовское априорное распределение.]
Пусть — семейство плотностей вероятности. Информацию Кульбака—Лейблера для различения двух плотностей из можно записать как
Напомним, что градиент есть , а гессиан — .
Если интегрирование и дифференцирование можно менять местами, покажите, что
где — информация Фишера для .
George and McCulloch (1993) утверждают, что выбор представляет собой привлекательный наименее информативный выбор априорного распределения. Какое обоснование вы можете этому дать?