Оптимальность по среднему риску
[116/0%]Проверьте выражения для и в Примере 1.3.
Приведите примеры пар значений , для которых бета-плотность является
убывающей,
возрастающей,
возрастающей при и убывающей при , и
убывающей при и возрастающей при .
В Примере 1.5, если имеет несобственную априорную плотность , покажите, что апостериорная плотность при заданном является собственной, при условии .
В Примере 1.5 найдите априорное распределение Джеффриса для и соответствующую байесовскую оценку .
Для оценки из Задачи 1.4,
вычислите смещение и максимальное смещение;
вычислите ожидаемую квадратичную ошибку и сравните её с ожидаемой квадратичной ошибкой UMVU-оценки.
В Примере 1.5 найдите байесовскую оценку параметра , когда имеет априорное распределение .
Для ситуации Примера 1.5 UMVU-оценка равна (см. Пример 2.3.1 и Задачу 2.3.1).
Сравните оценку из Задачи 1.6 с UMVU-оценкой .
Сравните ожидаемую квадратичную ошибку оценки для априорного распределения Джеффриса в Примере 1.5 с ожидаемой квадратичной ошибкой .
По аналогии с Задачей 1.2 определите возможные формы гамма-плотности .
Пусть — независимые одинаково распределённые согласно распределению Пуассона , и пусть имеет гамма-распределение .
Для квадратичной функции потерь покажите, что байесовская оценка параметра имеет представление, аналогичное (1.1.13).
Что происходит с , если (i) , (ii) , или оба одновременно?
Для ситуации предыдущей задачи решите два пункта, соответствующие пунктам (a) и (b) Задачи 1.5.
В Задаче 1.9, если имеет несобственную априорную плотность (соответствующую 0), при каких условиях апостериорное распределение является собственным?
Решите задачи, аналогичные Задачам 1.9 и 1.10, когда наблюдения состоят из одной случайной величины , имеющей отрицательное биномиальное распределение , имеет бета-априорное распределение , а оцениваемым параметром является
, и
.
Обращаясь к Примеру 1.5, предположим, что имеет биномиальное распределение , а семейство априорных распределений для является семейством бета-распределений .
Покажите, что маргинальное распределение является бета-биномиальным распределением с функцией вероятности
Покажите, что среднее и дисперсия бета-биномиального распределения задаются формулами
[Указание: Для пункта (b) полезны тождества и .]
Для ситуации Примера 2.1, Lindley и Phillips (1976) приводят подробное описание влияния правил остановки, которое мы можем проиллюстрировать следующим образом. Пусть — число успехов в испытаниях Бернулли с вероятностью успеха .
Предположим, что число проведённых испытаний Бернулли является заранее заданным числом , так что мы имеем биномиальную модель выборки, , . Вычислите байесовский риск байесовской оценки (1.1.12) и UMVU-оценки .
Предположим, что число проведённых испытаний Бернулли является случайной величиной . Значение было получено, когда было замечено заранее заданное число успехов, так что мы имеем модель отрицательной биномиальной выборки, , . Вычислите байесовский риск байесовской оценки и UMVU-оценки .
Вычислите среднеквадратичные ошибки всех трёх оценок для каждой модели. Если неизвестно, какой механизм выборки породил данные, какую оценку вы предпочтёте в целом?
Покажите, что оценка (2.2.4) сходится по вероятности
к при ,
к при , и
к при .
Bickel и Mallows (1988) более подробно исследуют связь между несмещённостью и байесовским подходом, указывая условия, при которых эти свойства не могут выполняться одновременно. Кроме того, они показывают, что если априорное распределение несобственно, то апостериорное среднее может быть несмещённым. Пусть , где , и пусть , .
Покажите, что , так что несмещена.
Покажите, что является собственной плотностью.
Покажите, что , и, следовательно, апостериорное среднее несмещено.
DasGupta (1994) приводит тождество, связывающее байесовский риск со смещением, которое иллюстрирует, что небольшое смещение может помочь достичь малого байесовского риска. Пусть и . Байесовская оценка при квадратичной функции потерь равна . Покажите, что байесовский риск может быть записан как
где — смещение .
Проверьте оценку (2.2.10).
В Примере 2.6 проверьте, что апостериорное распределение есть .
В Примере 2.6 при покажите, что апостериорное распределение при заданных является -распределением Стьюдента с степенями свободы.
В Примере 2.6 покажите, что апостериорное распределение симметрично относительно , когда совместное априорное распределение и имеет вид , где — произвольная плотность вероятности на .
Rukhin (1978) исследует ситуацию, когда байесовская оценка одна и та же для каждой функции потерь из некоторого множества функций потерь, называя такие оценки универсальными байесовскими оценками. Для случая Примера 2.6, используя априорное распределение вида, указанного в Задаче 2.9, покажите, что является байесовской оценкой при любой чётной функции потерь.
Пусть и независимо распределены согласно распределениям и соответственно. Предположим, что и являются вещественнозначными и независимы согласно некоторым априорным распределениям и . Если при квадратичной функции потерь — байесовская оценка на основе , а — байесовская оценка на основе ,
покажите, что является байесовской оценкой на основе ;
если и — байесовская оценка на основе , покажите, что является байесовской оценкой на основе .
Для плотности (2.2.13) и несобственного априорного распределения покажите, что апостериорное распределение остаётся несобственным.
В Примере 2.7 получите априорное распределение Джеффриса для .
Покажите, что для априорного распределения из пункта (a) апостериорное распределение является собственным.
Проверьте байесовскую оценку (2.2.14).
Пусть и .
Покажите, что является пределом байесовских оценок , где есть . Следовательно, является одновременно обобщённой байесовской оценкой и пределом байесовских оценок.
Для априорной меры , покажите, что обобщённая байесовская оценка равна .
Для покажите, что не существует последовательности собственных априорных распределений, для которой .
Этот пример принадлежит Farrell; см. Kiefer 1966. Heath и Sudderth (1989), опираясь на работу Stone (1976), показали, что выводы из этой модели некогерентны, и установили, когда обобщённые байесовские оценки приводят к когерентным (то есть непротиворечивым) выводам. Их работа связана с теорией «аппроксимируемости собственными априорными распределениями», развитой Stein (1965) и Stone (1965, 1970, 1976), которая показывает, когда обобщённые байесовские оценки можно рассматривать как байесовские оценки.
Для ситуации Примера 2.8 проверьте, что является обобщённой байесовской оценкой.
Если и , покажите, что является обобщённой байесовской оценкой при несобственном априорном распределении .
Для ситуации Примера 3.1:
Проверьте, что байесовская оценка зависит от данных только через .
Покажите, что можно выразить как
где — случайная величина, имеющая распределение хи-квадрат с степенями свободы. (В таком виде оценку особенно легко вычислить, поскольку многие компьютерные пакеты имеют встроенное распределение хи-квадрат.)
Пусть — независимые одинаково распределённые из , где известно.
Проверьте, что сопряжённое априорное распределение для естественного параметра эквивалентно обратному гамма-распределению для .
Используя априорное распределение из пункта (a), найдите байесовскую оценку при функциях потерь (i) и (ii) .
Выразите оценку из пункта (b)(i) в виде (3.3.9). Можно ли сделать то же самое для оценки из пункта (b)(ii)?
Следствие 3.3 утверждает: если имеет плотность , а имеет априорную плотность , то байесовская оценка при функции потерь задаётся формулой
Докажите Следствие 3.3.
Проверьте вычисление байесовской оценки в Примере 3.4.
Используя тождество Стейна (Лемма 1.5.15), покажите, что если из (3.3.7), то
Если , независимы, с известным , вычислите и его математическое ожидание.
Примените результаты пункта (a) к ситуации, когда , независимы. Приводит ли это к несмещённой оценке ? [Замечание: Для пункта (b) квадратичная функция потерь для естественного параметра приводит к функции потерь для оценивания .]
Если
вычислите и покажите, что это несмещённая оценка .
Для ситуации Примера 3.6:
Покажите, что если — байесовская оценка , то является байесовской оценкой , и, следовательно, .
Покажите, что риск байесовской оценки задаётся формулой
где .
Если — фиксированная константа, то минимальный риск достигается при .
Если имеет распределение из (1.5.1), покажите, что, аналогично Теореме 3.2, .
Используя тождество Стейна (Лемма 1.5.15), покажите, что если из (3.3.18), то
Если — независимые одинаково распределённые из гамма-распределения , где параметр формы известен, используя пункт (a), найдите несмещённую оценку .
Если — независимые одинаково распределённые из бета-распределения , можно ли использовать тождество из пункта (a) для получения несмещённой оценки , когда известно, или несмещённой оценки , когда известно?
Для естественного экспоненциального семейства из (3.3.7) и сопряжённого априорного распределения из (3.3.19) докажите, что:
и var , где математическое ожидание берётся относительно выборочной плотности .
и , где математическое ожидание берётся относительно априорного распределения.
[Результаты пункта (b) позволяют рассматривать как априорное среднее, а — как объём априорной выборки.]
Для каждой из следующих ситуаций запишите плотность в виде (3.7) и укажите естественный параметр. Найдите байесовскую оценку при квадратичной функции потерь и сопряжённом априорном распределении. Выразите ответ через исходные параметры.
биномиальное ,
Пуассона, и
, известно.
Для ситуации задачи 3.9, если — независимые одинаково распределённые как , а априорное распределение — сопряжённое , то апостериорное распределение равно .
Если — независимые одинаково распределённые из однопараметрического экспоненциального семейства, то байесовская оценка среднего при квадратичной функции потерь с использованием сопряжённого априорного распределения имеет вид для некоторых констант и .
Если и var , то независимо от распределения среднеквадратичная ошибка равна
Если не ограничено, то никакая оценка вида не может иметь конечную среднеквадратичную ошибку при .
Может ли байесовская оценка с сопряжённым априорным распределением в экспоненциальном семействе иметь конечную среднеквадратичную ошибку?
Эта задача показывает, почему байесовские оценки с сопряжённым априорным распределением считаются «неробастными».
Для ситуации примера 4.2:
Покажите, что байесовское правило при априорном распределении бета эквивариантно.
Покажите, что байесовское правило при любом априорном распределении, симметричном относительно , эквивариантно.
Байесовская оценка в примере 4.7 задаётся формулой (4.22).
Байесовская оценка в примере 4.5 задаётся формулой (4.22).
Байесовские оценки и в примере 4.9 задаются формулами (4.31) и (4.32). (Вспомните следствие 1.2.)
Для каждой из следующих ситуаций найдите группу , оставляющую модель инвариантной, и определите лево- и право-инвариантные меры на . Совместная плотность и и оцениваемый параметр таковы:
, оцениваемый параметр ;
, оцениваемый параметр ;
неизвестно; оцениваемый параметр .
Для каждой из ситуаций задачи 4.5 найдите MRE-оценку, если функция потерь — квадратичная ошибка с масштабированием, обеспечивающим её инвариантность.
Для каждой из ситуаций задачи 4.5:
Найдите меру на , индуцированную право-инвариантной мерой Хаара на ;
Найдите байесовскую оценку относительно меры, найденной в пункте (a), и покажите, что она совпадает с MRE-оценкой.
В примере 4.9 покажите, что оценка
эквивариантна относительно изменений масштаба, то есть удовлетворяет для всех значений , при которых интегралы в существуют.
Если — лево-инвариантная мера на , покажите, что , определённая как , право-инвариантна, где .
Между мерами Хаара и априорными распределениями Джеффриса в случаях сдвига и масштаба существует соответствие.
Покажите, что в случае параметра сдвига априорное распределение Джеффриса совпадает с инвариантной мерой Хаара.
Покажите, что в случае параметра масштаба априорное распределение Джеффриса совпадает с инвариантной мерой Хаара.
Покажите, что в случае сдвига-масштаба априорное распределение Джеффриса совпадает с лево-инвариантной мерой Хаара.
[Пункт c) вызывает определённое беспокойство, поскольку, как отмечено в разделе 4.4 (см. обсуждение после примера 4.9), наилучшее эквивариантное правило является байесовским относительно право-инвариантной меры Хаара (если она существует).]
Для модели (3.3.23) найдите меру на плоскости , остающуюся инвариантной относительно преобразований (3.3.24). Следующие три задачи содержат более формальное изложение лево- и право-инвариантных мер Хаара.
Мера на группе называется право-инвариантной, если она удовлетворяет , и лево-инвариантной, если она удовлетворяет . Заметим, что если коммутативна, оба определения совпадают.
Если элементы — вещественные числа , а групповая операция задаётся как , то мера , определённая как (т.е. мера Лебега), является как лево-, так и право-инвариантной.
Если элементы — положительные вещественные числа, а композиция и — это произведение этих двух чисел, то мера , определённая как , является как лево-, так и право-инвариантной.
Если элементы — пары вещественных чисел , , соответствующие преобразованиям , то групповая операция по (1.4.8) имеет вид
Из мер, определённых как
первая право-, но не лево-инвариантна, а вторая лево-, но не право-инвариантна.
Четыре плотности, определяющие меры в задачах 4.12 и , ), являются единственными плотностями (с точностью до мультипликативных констант), для которых обладает указанными свойствами инвариантности в ситуациях этих задач.
Для модели (3.3.1) пусть — байесовское апостериорное распределение при фиксированном априорном распределении, а — иерархическое байесовское апостериорное распределение. Покажите, что , где .
Для ситуации задачи 5.1 покажите, что:
;
;
и, следовательно, что будет, как правило, иметь бо́льшую дисперсию, чем .
Для модели (3.3.3) покажите, что:
Маргинальное априорное распределение , безусловное относительно , задаётся формулой
которое при и является -распределением Стьюдента с степенями свободы.
Маргинальное апостериорное распределение задаётся формулой
Albert and Gupta (1985) исследуют теорию и приложения иерархической модели
Покажите, что
[Заметим, что и не выражаются в простом виде.]
Безусловно по , величины имеют условную ковариацию
Игнорируя априорное распределение , покажите, как построить эмпирическую байесовскую оценку . (Опять же, она не выражается в простом виде.)
[Albert and Gupta (1985) на самом деле рассматривают более общую модель, чем приведённая здесь, и показывают, как приближённо получить байесовское решение. Они применяют свою модель к задаче об отсутствии ответов при почтовых опросах.]
По аналогии с задачей 1.7.9 докажите, что для любых случайных величин и ,
Для иерархии
покажите, что .
Если , где и известны, то
[Пункт (c) указывает на определённое ограничение применимости некоторых иерархических моделей, а именно на то, что они влекут положительную корреляционную структуру в апостериорном распределении.]
Модель однофакторных случайных эффектов из примера 2.7 (см. также примеры 3.5.1 и 3.5.5) можно записать в виде иерархической модели
Если, кроме того, положить равномерное , покажите, что байесовская оценка при квадратичной функции потерь задаётся формулой (3.5.13) — UMVU-предиктором .
Обращаясь к примеру 6.6:
Используя априорное распределение для , заданное в (5.6.27), покажите, что мода апостериорного распределения равна , и, следовательно, эмпирическая байесовская оценка, основанная на этом , не совпадает с иерархической байесовской оценкой (5.6.29).
Покажите, что если оценивать с помощью его апостериорного математического ожидания , то получаемая эмпирическая байесовская оценка совпадает с иерархической байесовской оценкой.
Метод интегрирования Монте-Карло позволяет вычислять (возможно, сложные) интегралы с помощью (возможно, простой) генерации случайных величин.
Чтобы вычислить , сгенерируйте выборку , независимую одинаково распределённую, из . Тогда при .
Если трудно сгенерировать случайную величину из , то сгенерируйте пары случайных величин
Тогда при . [Покажите, что если генерируется согласно и , то .]
Если сгенерировать, как в пункте (b), затруднительно, то сгенерируйте
для и .
Покажите, что:
-
для каждого последовательность является цепью Маркова. Если это к тому же эргодическая цепь Маркова, то при , где имеет стационарное распределение цепи.
-
Если стационарное распределение цепи равно , то
при .
Это основная теория, лежащая в основе сэмплера Гиббса. Для каждого мы сгенерировали независимые случайные величины , где распределена согласно . Также верно, что для каждого и большого величина распределена приближённо согласно , хотя эти величины уже не являются независимыми. Преимущества и недостатки этих вычислительных схем (одна длинная цепь против многих коротких цепей) обсуждаются в Gelman and Rubin 1992; см. также Geyer and Thompson 1992 и Smith and Roberts 1992. Преобладающее мнение склоняется в пользу одной длинной цепи.
Чтобы понять сходимость сэмплера Гиббса, пусть , и определим
Покажите, что функция , решающая уравнение , есть — маргинальное распределение .
Запишите аналогичное интегральное уравнение, которому удовлетворяет .
Определите последовательность функций рекуррентно как , где произвольна, но удовлетворяет . Покажите, что
и, следовательно, сходится к .
[Метод пункта (c) называется методом последовательных подстановок. Когда в сэмплере Гиббса участвуют две переменные, он эквивалентен аугментации данных (Tanner and Wong 1987). Даже если переменные векторнозначны, приведённые выше результаты устанавливают сходимость. Если исходный вектор переменных содержит более двух переменных, то требуется более общая версия этого рассуждения (Gelfand and Smith 1990).]
Прямая реализация подстановочной выборки методом Монте-Карло обеспечивается алгоритмом аугментации данных (Tanner and Wong 1987). Если определить
то по задаче 5.9 при .
Чтобы вычислить методом интегрирования Монте-Карло:
-
Сгенерируйте .
-
Для каждого сгенерируйте .
-
Вычислите . Тогда при , и, следовательно, алгоритм аугментации данных сходится.
Чтобы реализовать (a)(i), нужно уметь генерировать случайную величину из смеси распределений. Покажите, что если , то алгоритм
-
Выбрать с вероятностью
-
Сгенерировать порождает случайную величину с распределением .
Отсюда покажите, как реализовать шаг (a)(i), генерируя случайные величины из . Tanner and Wong (1987) отмечают, что этот алгоритм работает даже при , что даёт приближение
идентичное сэмплеру Гиббса. Алгоритм аугментации данных можно также рассматривать как применение процедуры множественной импутации (multiple imputation) (Rubin 1976, 1987, Little and Rubin 1987).
Выборку методом последовательных подстановок можно реализовать через сэмплер Гиббса следующим образом. Из задачи 5.8(c) требуется вычислить
Покажите, что при .
При заданном приближение Монте-Карло к имеет вид
где и при .
Следовательно, при .
Это сэмплер Гиббса, который обычно реализуется при .
Для ситуации примера 5.6 покажите, что
Обсудите, когда в (b) может достигаться равенство. Можете ли вы привести пример?
Покажите, что для иерархии (5.5.1) апостериорные распределения и удовлетворяют
и, следовательно, являются стационарными точками цепей Маркова в (5.5.13).
Исходя из равномерной случайной величины , с помощью преобразований можно построить многие случайные величины.
Покажите, что .
Покажите, что , где — независимые одинаково распределённые как .
Пусть . Запишите как функцию от .
Пусть , — целое число. Запишите как функцию от , независимых одинаково распределённых как .
Начиная со случайной величины , преобразования из задачи 5.14 не позволяют получить нормальные случайные величины или гамма-случайные величины с нецелым параметром формы. Один из способов сделать это — использовать алгоритм принятия-отклонения (Accept-Reject Algorithm) (Ripley 1987, раздел 3.2), алгоритм для моделирования :
-
Сгенерировать , независимо.
-
Вычислить где .
-
Если , положить , иначе вернуться к i).
Покажите, что этот алгоритм генерирует .
Начиная с , покажите, как сгенерировать .
Покажите, как сгенерировать гамма-случайную величину с нецелым параметром формы.
Рассмотрим нормальную иерархическую модель
где , известны.
Покажите, что апостериорное распределение равно
где и .
Найдите выражение для информации Кульбака—Лейблера и покажите, что она является убывающей функцией .
В первоначальном доказательстве теоремы 5.7 (Goel and DeGroot 1981) использовалась энтропийная функция Реньи (Rényi 1961)
где и — плотности, — доминирующая мера, а — постоянная, .
Покажите, что удовлетворяет и .
Покажите, что теорема 5.7 остаётся верной, если вместо использовать .
Покажите, что , и приведите другое доказательство теоремы 5.7.
Информация Кульбака—Лейблера (5.5.25) не симметрична по и , и модификация, называемая дивергенцией, устраняет эту асимметрию. Определим — дивергенцию между и — как . Покажите, что, аналогично теореме 5.7, .
Goel and DeGroot (1981) определяют байесовский аналог информации Фишера [см. (2.5.10)] как
— информацию, которую несёт об апостериорном распределении. Как и в теореме 5.7, покажите, что , что снова показывает, что влияние меньше влияния .
Каждая из спор имеет вероятность прорастания. Из проросших спор каждая имеет вероятность изогнуться в определённом направлении. Если изгибается в этом определённом направлении, то вероятностная модель, описывающая этот процесс, — двумерное биномиальное распределение с функцией вероятности
Покажите, что априорное распределение Джеффриса равно .
Если рассматривается как мешающий параметр, то референсное априорное распределение равно
Сравните апостериорные средние при априорном распределении Джеффриса и при референсном априорном распределении. Является ли одно из них более подходящим?
Как разные априорные распределения влияют на апостериорную дисперсию?
[Априорные распределения для двумерного биномиального распределения рассматривались в работах Crowder and Sweeting (1989), Polson and Wasserman (1990) и Clark and Wasserman (1993), которые предлагают компромиссное референсное/джеффрисовское априорное распределение.]
Пусть — семейство плотностей вероятности. Информацию Кульбака—Лейблера для различения двух плотностей из можно записать как
Напомним, что градиент есть , а гессиан — .
Если интегрирование и дифференцирование можно менять местами, покажите, что
где — информация Фишера для .
George and McCulloch (1993) утверждают, что выбор представляет собой привлекательный наименее информативный выбор априорного распределения. Какое обоснование вы можете этому дать?
Для модели (3.3.1) покажите, что , где байесовская оценка минимизирует , а эмпирическая байесовская оценка минимизирует .
В этой задаче исследуются условия, при которых эмпирическая байесовская оценка является байесовской оценкой. Выражение (6.6.3) представляет собой истинные апостериорные ожидаемые потери, если является истинным апостериорным распределением.
Исходя из иерархии
определим совместное распределение и как , где получается подстановкой вместо в .
Покажите, что для этой совместной плотности формальная байесовская оценка эквивалентна эмпирической байесовской оценке из иерархической модели.
Если и — собственные плотности, то . Однако не обязано быть конечным.
Для модели (6.3.1) байесовская оценка минимизирует , а эмпирическая байесовская оценка минимизирует . Покажите, что .
Для ситуации примера 6.1:
Покажите, что
и, тем самым, установите (6.6.4).
Проверьте, что маргинальная MLE-оценка равна и что эмпирическая байесовская оценка задаётся формулой (6.6.5).
Обращаясь к примеру 6.2:
Покажите, что байесовский риск байесовской оценки (6.6.7) задаётся формулой
Покажите, что байесовский риск несмещённой оценки задаётся формулой
Теорема 6.3 утверждает: для ситуации следствия 3.3 (если имеет плотность , а имеет априорную плотность , то байесовская оценка при квадратичной функции потерь равна ), с априорным распределением ; пусть — MLE-оценка , основанная на . Тогда эмпирическая байесовская оценка равна
Обобщите теорему 6.3 на случай теоремы 3.2; то есть, если имеет плотность (3.3.7), а имеет априорную плотность , то эмпирическая байесовская оценка равна
где — маргинальное распределение X, а — маргинальная MLE-оценка .
Для из (1.5.2) покажите, что для любого априорного распределения , зависящего от гиперпараметра , эмпирическая байесовская оценка задаётся формулой
где .
Если X имеет распределение из (1.5.1), покажите, что справедлива аналогичная формула, а именно
где — якобиан , а — вектор градиента , то есть .
Для каждой из следующих ситуаций запишите эмпирическую байесовскую оценку естественного параметра (при квадратичной функции потерь) в виде (6.6.12), используя оценку максимального маргинального правдоподобия гиперпараметра . Вычислите выражения настолько, насколько это возможно.
, независимы; .
, независимы, .
Strawderman (1992) показывает, что оценку Джеймса—Стейна можно рассматривать как эмпирическую байесовскую оценку в произвольном семействе сдвига. Пусть , где и var . Пусть априорное распределение есть — -кратная свёртка с самой собой. [Свёртка с самой собой — это . -кратная свёртка — это .] Эквивалентно, пусть , независимые одинаково распределённые, , и .
Покажите, что байесовское правило при квадратичной функции потерь равно . Заметим, что является априорным параметром.
Покажите, что является несмещённой оценкой , и, следовательно, эмпирическая байесовская оценка задаётся формулой .
Покажите для иерархии из примера 3.4, где и известны, а неизвестно, что:
Эмпирическая байесовская оценка , основанная на маргинальной MLE-оценке , равна .
Байесовский риск, при функции потерь в виде суммы квадратов ошибок, эмпирической байесовской оценки из пункта (a) равен
Минимальный риск эмпирической байесовской оценки достигается, когда все равны. [Указание: Покажите, что .]
Для из (5.5.8) покажите, что при — байесовской оценке при априорном распределении .
Покажите, что эмпирическая байесовская оценка из (6.6.5) имеет ограниченную среднеквадратичную ошибку.
Покажите, что вариант из пункта (a), , также имеет ограниченную среднеквадратичную ошибку.
При постройте графики функций риска оценок из пунктов (a) и (b).
[Thompson (1968a, 1968b) исследовал свойства среднеквадратичной ошибки оценок, подобных приведённым в пункте (b). Хотя такие оценки имеют меньшую среднеквадратичную ошибку, чем , при малых значениях , они всегда имеют бо́льшую среднеквадратичную ошибку при бо́льших значениях .]
Для иерархии (5.5.7), при и , вычислите байесовский риск байесовской оценки (5.5.8) при и 10.
Вычислите байесовский риск оценки из задачи 6.12(b). Найдите значение , дающее хорошее приближение к риску иерархической байесовской оценки. Сравните его с байесовским риском эмпирической байесовской оценки из задачи 6.12(a).
Обращаясь к примеру 6.6, покажите, что эмпирическая байесовская оценка также является иерархической байесовской оценкой при использовании априорного распределения .
Аппроксимация оценки (5.5.8) рядом Тейлора выполняется в несколько шагов. Покажите, что:
Используя разложение Тейлора первого порядка в окрестности точки , имеем
где остаточный член удовлетворяет при .
Остаточный член из пункта (a) также удовлетворяет
Числитель и знаменатель (5.5.8) можно записать как
и
что даёт (5.6.32).
Для ситуации примера 6.7:
Вычислите значения приближения (5.6.32) для значений из таблицы 6.2. Существуют ли ситуации, в которых оценка (5.6.32) явно предпочтительнее эмпирической байесовской оценки (5.6.5) как приближение к иерархической байесовской оценке (5.5.8)?
Расширьте рассуждение из задачи 6.15, чтобы вычислить следующий член разложения, и тем самым получите более точное приближение к иерархической байесовской оценке (5.5.8). Для значений из таблицы 6.2, предпочтительнее ли это новое приближение к (5.5.8), чем (5.6.5) и (5.6.32)?
Покажите, что если имеет ограниченную вторую производную, то
где — единственный минимум , и константа при . [Указание: Разложите и в ряд Тейлора в окрестности до членов второго порядка. Затем проведите почленное интегрирование.] Это приближение Лапласа для интеграла. Об уточнениях и других разработках этого приближения в байесовском выводе см. Tierney and Kadane 1986, Tierney, Kass, and Kadane 1989, и Robert 1994a (раздел 9.2.3).
Для иерархической модели (5.5.1) апостериорное среднее можно приблизить как
где , а — мода , апостериорного распределения .
Если — нормальное распределение со средним и дисперсией , то .
Покажите, что ситуация из пункта (c) возникает из иерархии
Примените приближение Лапласа (5.6.33), чтобы получить приближение к иерархической байесовской оценке из примера 6.6.
Сравните приближение из пункта (a) с эмпирической байесовской оценкой (5.6.24). Какое из них лучше приближает иерархическую байесовскую оценку?
Примените приближение Лапласа (5.6.33) к иерархии из примера 6.7 и покажите, что получаемое приближение к иерархической байесовской оценке задаётся формулой (5.6.32).
Проверьте (6.6.37) — что при квадратичной функции потерь
Для и , определите, какая оценка более робастна согласно (6.6.37) — или .
Существует ли оценка вида , которую вы считали бы более робастной, в смысле (6.6.37), чем каждая из оценок пункта (b)?
[В пункте (b), при фиксированных и , вычислите байесовский риск и для нескольких пар .]
Установите (6.6.39) и (6.6.40) для класса априорных распределений, заданного в (6.6.38).
Покажите, что байесовская оценка, основанная на в (6.6.38), при квадратичной функции потерь задаётся формулой (6.6.41).
Для ситуации примера 7.1:
Эмпирическая байесовская оценка , использующая несмещённую оценку , равна
— оценке Джеймса—Стейна.
Эмпирическая байесовская оценка , использующая маргинальную MLE-оценку , равна
что напоминает положительную часть оценки Стейна.
Следствие 7.2 утверждает: пусть , и пусть оценка имеет вид , где дифференцируема. Если для , то
Докажите следствие 7.2. Обязательно проверьте, что условия на достаточны, чтобы допустить рассуждение с интегрированием по частям. [Stein развивает эти представления в нормальном случае.]
Вывод несмещённой оценки риска (следствие 7.2) можно распространить на более общую модель в экспоненциальном семействе — модель следствия 3.3, где имеет плотность
Байесовская оценка при квадратичной функции потерь равна
Покажите, что риск имеет несмещённую оценку
[Указание: теорема 3.5 и задача 3.4.]
Покажите, что риск эмпирической байесовской оценки
из теоремы 6.3 имеет несмещённую оценку
Используя результаты пункта (b), выведите несмещённую оценку риска положительной части оценки Стейна из (7.7.10).
Проверьте (7.7.9) — выражение для байесовского риска . (Задача 3.12 может оказаться полезной.)
Общий вид эмпирической байесовской оценки (7.7.3) задаётся как
где — положительная константа.
Используя следствие 7.2, проверьте, что
Покажите, что байесовский риск при задаётся формулой
и минимизируется при выборе .
Для модели
Покажите, что:
Эмпирическая байесовская оценка, использующая несмещённую оценку , является оценкой Стейна
Если , байесовский риск при квадратичной функции потерь оценки равен , где — байесовский риск байесовской оценки.
Если , байесовский риск бесконечен. [Указание: Покажите, что если , то .
Для модели
байесовский риск обычной оценки Стейна
равномерно больше, чем у её положительной части
Теорема 7.5 верна в большей общности, чем только для нормального распределения. Предположим, что распределена согласно многомерной версии экспоненциального семейства из (33.7),
и используется многомерное сопряжённое априорное распределение [обобщающее (3.19)].
Покажите, что .
Если в априорном распределении (см. 3.19), покажите, что , где и .
Если , оценка изменяется на . Установите результат, аналогичный пункту (b), для этой оценки.
Для модели (7.7.15) покажите, что маргинальное распределение — отрицательное биномиальное ; то есть
с и var .
Если независимые одинаково распределённые согласно отрицательному биномиальному распределению из пункта (a), покажите, что условное распределение — отрицательное гипергеометрическое распределение, задаваемое как
с и var .
Для ситуации примера 7.6:
Покажите, что байесовская оценка при функции потерь из (7.7.16) задаётся формулой (7.7.17).
Проверьте (7.7.19) и (7.7.20).
Вычислите байесовские риски и . Какая оценка, или , более робастна?
Для ситуации примера 7.6 вычислите байесовский риск эмпирической байесовской оценки (7.7.20) при и 1. При каких значениях неизвестного гиперпараметра эмпирическая байесовская оценка оказывается в наименее, а при каких — в наиболее выгодном положении?
Рассмотрим иерархическую байесовскую оценку для пуассоновской модели (7.7.15) при функции потерь (7.7.16). Используя распределение (5.6.27) для гиперпараметра , покажите, что байесовская оценка равна
[Указание: Покажите, что байесовская оценка равна и что
Докажите следующее: два матричных результата, полезных при вычислении оценок в многомерных иерархических моделях:
Для любого вектора вида .
Если — идемпотентная матрица (то есть ), а — скаляр, то
Для ситуации примера 7.7:
Покажите, как вывести эмпирическую байесовскую оценку из (7.7.28).
Проверьте байесовский риск из (7.7.29).
Для ситуации примера 7.8:
Покажите, как вывести эмпирическую байесовскую оценку из (7.7.33).
Проверьте байесовский риск , (7.7.34).
Эмпирическую байесовскую оценку (7.7.27) можно также вывести как иерархическую байесовскую оценку. Рассмотрим иерархическую модель
где и известны.
Покажите, что байесовская оценка при квадратичной функции потерь равна
где — апостериорное среднее .
Установите, что . [Это можно сделать, вычислив математическое ожидание напрямую, либо показав, что апостериорное распределение есть
Заметим, что величины не являются независимыми апостериори. В самом деле,
где .
Покажите, что эмпирическую байесовскую оценку (7.7.32) также можно вывести как иерархическую байесовскую оценку, добавив к иерархии (7.7.30) спецификацию равномерное [то есть ].
Обобщение модели (7.7.23) на случай неравных , возможно, не так просто, как можно было бы ожидать. Рассмотрим обобщение
Предположим также, что . Покажите, что:
Приведённая выше модель эквивалентна
где и .
Байесовская оценка при квадратичной функции потерь равна
Маргинальное распределение есть , и эмпирическая байесовская оценка равна
где и . [Без предположения получить простую эмпирическую байесовскую оценку не удаётся. Если , для получения оценки , используемой в эмпирической байесовской оценке, можно применить оценивание по методу правдоподобия. Это обсуждается у Morris (1983a).]
(Эмпирическое байесовское оценивание в общем случае). Общий вид иерархических моделей из примеров 7.7 и 7.8:
где и ранга известны, а и неизвестны. Для этой модели покажите, что:
Байесовская оценка при квадратичной функции потерь равна
Маргинально распределение есть .
При маргинальном распределении из пункта (b)
и, следовательно, эмпирическая байесовская оценка равна
Байесовский риск равен , где — риск байесовской оценки.
Аналогично предыдущей задаче, можно вывести иерархические байесовские оценки для модели
где и ранга известны, а неизвестно.
Априорное распределение , безусловное относительно , пропорционально
где проектирует из в . [Указание: Установите, что
чтобы выполнить интегрирование по .]
Покажите, что
где , и, следовательно, байесовская оценка задаётся формулой
где . [Указание: Установите, что
где .]
Маргинально, . Это приводит нас к эмпирической байесовской оценке
которая равна эмпирической байесовской оценке из задачи 7.17(c).
[Модель в этой и предыдущей задаче можно существенно обобщить. Например, обе матрицы и можно заменить полными положительно определёнными матрицами. Ценой увеличения сложности матричных вычислений и потери простых ответов иерархические и эмпирические байесовские оценки всё же можно вычислить. Ковариации, скалярные или матричные, также могут быть неизвестны, и в этом случае можно использовать обратное гамма-распределение (или обратное распределение Уишарта) в качестве априорного. Вычисления можно реализовать с помощью сэмплера Гиббса. Заметим, что эти обобщения охватывают случай «неравных » (см. задачу 7.16), однако для этого случая простых решений не существует. Многие из этих оценок также обладают свойством минимаксности, которое будет обсуждаться в главе 5.]
Как отмечено Morris (1983a), иерархическая модель типа дисперсионного анализа с неравными даёт эмпирические байесовские оценки в замкнутой форме, если априорные дисперсии пропорциональны выборочным дисперсиям. Покажите, что для модели
где и полного ранга известны, неизвестно, а , эмпирическая байесовская оценка задаётся формулой
с , и .
Занимательный (и необоснованный) результат, злоупотребляющий иерархическим байесовским вычислением, приводит к следующему выводу оценки Джеймса—Стейна. Пусть и .
Проверьте, что при условии апостериорное и маргинальное распределения задаются формулами
Покажите, что, если положить , то
и
и, следовательно,
Объясните некоторые следствия результата из пункта (b) и то, почему он не может быть верным. [Попробуйте согласовать его с (3.3.12).]
Почему вычисления в пункте (b) необоснованны?