Множественная регрессия
[40/100%]Это уравнение множественной регрессии было оценено по данным 2005 года для 100 домов в Плано, штат Техас: где: цена дома площадь жилого помещения в квадратных футах G = площадь гаража в квадратных футах A = возраст дома в годах BR = число спален BA = число ванных комнат , если есть центральное кондиционирование, 0 если нет и стандартные ошибки приведены в скобках.
Какие из оценённых коэффициентов статистически убедительны?
Дайте логическое объяснение тому, почему коэффициент при BR может быть отрицательным.
Как вы думаете, меняются ли со временем коэффициенты в уравнениях регрессии для жилья? Почему да или почему нет?
Данные о продажах одноквартирных домов в пригороде Индианаполиса были использованы для оценки следующего уравнения в 2005 году:
где: Y = цена продажи площадь жилого помещения в квадратных футах G = площадь гаража в квадратных футах A = возраст дома в годах B = число ванных комнат , если дом двухэтажный, 0 если нет.
Стандартные ошибки приведены в скобках.
Какие из оценённых коэффициентов статистически значимы на уровне ? Как это определить?
Кажутся ли вам знак и величина каждого коэффициента разумными? В каждом случае объясните ваши рассуждения.
Найдите пять ошибок в следующих отчётных результатах модели множественной регрессии для прогнозирования числа продаж домов, использующей квартальные данные временных рядов с 2001 по 2020 год:
| Объясняющая переменная | Коэффициент | Стандартная ошибка | |t-значение| | Двусторонний p-value |
|---|---|---|---|---|
| Свободный член | -1703.00 | 412.00 | 4.10 | .0001 |
| ВВП | 32.33 | 6.20 | 5.21 | -.0271 |
| Ипотечная ставка | -2245.61 | 711.42 | 3.16 | .0023 |
| Весна | 45.62 | 28.62 | 1.59 | .1161 |
| Лето | 35.55 | 21.44 | 1.66 | .1012 |
| Осень | -12.11 | 4.63 | 2.62 | .9894 |
| Зима | -48.79 | 15.72 | 3.10 | .0027 |
Найдите пять отдельных проблем в этой модели множественной регрессии, описывающей влияние COVID-19 на доходы владельцев малого бизнеса.
Earnings годовой доход от бизнеса, доллары COVID = 1 в месяцы COVID, 0 до COVID Race , если белый, 1 если чёрный, 2 если азиат
| Переменная | Коэффициент | Стандартная ошибка | t-статистика | Двусторонний p-value |
|---|---|---|---|---|
| Константа | 34,256.77 | 2,437.92 | 14.05 | .0385 |
| COVID | 1,327.38 | 770.95 | 1.72 | .0427 |
| Race | 450.22 | 125.43 | .28 | .000165 |
Исследование доходов адвокатов по семейному праву рассматривало влияние возраста, пола и оконченного юридического факультета:
где: средний доход за последние 5 лет X = текущий возраст , если мужчина, 1 если женщина , если окончил Гарвард, 2 если Йель, 3 если Стэнфорд, и 0 в остальных случаях.
Какая проблема в этой спецификации модели наиболее важна?
Студент оценил регрессионную модель, использующую число страниц в бестселлерах в твёрдом переплёте для прогнозирования их цены. Объясните, почему следующий вывод неверен: «R-квадрат в 0.75 довольно велик, если учесть, что цена книги составляет , и этой цены объясняется числом страниц».
Исследователь утверждал: «Мультиколлинеарность увеличивает стандартные ошибки коэффициентов объясняющих переменных, поэтому вероятность отклонения нулевой гипотезы для этих коэффициентов возрастает». Почему он неправ?
Исследователь использовал данные по 60 случайно отобранным колледжам: процент выпускников (среднее 59.65); медианный суммарный балл SAT студентов по математике и чтению/письму (среднее 1,030.5); и процент студентов с GPA среди верхних в своей средней школе (среднее ). Он обнаружил статистически значимую связь между процентом выпускников и баллами SAT (t-значения приведены в скобках):
и между процентом выпускников и GPA:
Однако когда он включил в уравнение множественной регрессии одновременно баллы SAT и GPA, оценённый эффект GPA на процент выпускников оказался очень небольшим и статистически незначимым на уровне :
Он заподозрил, что в его результатах множественной регрессии есть ошибка. Возможно ли, чтобы переменная была статистически значимой в простой регрессии, но незначимой в множественной регрессии?
Как вы думаете, и положительно коррелированы, отрицательно коррелированы или не коррелированы?
Если ваши рассуждения в пункте (b) верны, как это объяснило бы тот факт, что коэффициенты при и каждый ниже в уравнении множественной регрессии, чем в уравнениях простой регрессии?
Предположим, средний балл первого курса студента колледжа G можно спрогнозировать по среднему баллу студента в старшей школе H и стандартизированным результатам тестов T: , где и положительны, а H и T положительно коррелированы. Если T исключить из этого уравнения, как это повлияет на оценку методом наименьших квадратов коэффициента при H? Какой вред причиняет исключение T?
В исследовании сравнивалась дневная доходность портфеля акций с «остроумными» тикерами с показателями рынка в целом за 1984-2005 годы. Часть исследования включала оценку следующего регрессионного уравнения:
[3.45] [39.52] где Y — дневная доходность «остроумных» тикеров, X — дневная доходность рынка акций, а t-значения приведены в скобках.
Обновление этого исследования с использованием данных за 2006-2018 годы:
Как можно проверить, являются ли различия в оценённых коэффициентах (.00049 против .00026 и .81 против .88) статистически убедительными? Будьте конкретны.
Исследование влияния порядка рождения на GPA сообщило следующие результаты:
где: Y = GPA, шкала 0-4 X1 = рост, в дюймах X2 = 1, если женщина, 0 иначе X3 = 1, если единственный ребёнок, 0 иначе
X4 = 1, если первенец, 0 иначе X5 = 1, если не единственный ребёнок и не первенец, 0 иначе [ ] = абсолютное значение t-значений Почему вы подозреваете, что это не честный отчёт о результатах?
В судебном деле 1980 года федеральный судья описал, как оценки регрессионных уравнений зарплат мужчин и женщин могут быть использованы для определения того, дискриминирует ли работодатель женщин.
где: годовой заработок число лет образования число лет соответствующего профессионального опыта Судья также отметил, что вместо двух отдельных уравнений, одного для мужчин и одного для женщин, можно оценить следующее единое уравнение, где , если человек мужчина, и , если человек женщина:
В каком отношении это единое уравнение менее общее, чем два отдельных уравнения?
Какое единое уравнение мог бы указать судья, которое было бы столь же общим, как и два отдельных уравнения?
Следующая модель множественной регрессии использовалась для объяснения цен продажи (в тысячах долларов) 60 одноквартирных домов в Окснарде, Калифорния:
Интерпретируйте коэффициент -.1515.
Оценки каких коэффициентов (помимо константы) статистически убедительны?
Объясните, почему вы согласны или не согласны со следующим рассуждением: «Коэффициент при числе спален отрицателен, потому что при фиксированной жилой площади удвоение числа спален вдвое уменьшает размер каждой из них».
Объясните, почему вы согласны или не согласны со следующим рассуждением: «Коэффициент при числе ванных комнат положителен, потому что дома с большим числом ванных комнат, как правило, крупнее домов с меньшим их числом».
Исследование цен на дома в пригороде Род-Айленда использовало следующие переменные в модели множественной регрессии: цена площадь в квадратных футах число спален число ванных комнат Walk Score — рейтинг (от 0 до 100) для данного адреса, основанный на пешей доступности разнообразных ключевых объектов инфраструктуры. Walk Score 70 и выше обычно считается хорошим.
Что не так в следующей интерпретации результатов: «Коэффициент при отрицателен, потому что крупные дома с высокими ценами обычно расположены в отдалении от продуктовых магазинов, кофеен и других желаемых мест».
Вот таблица описательной статистики для данных, использованных для проверки того, зависит ли доход работников компании от пола или расы (Sex , если мужчина, 0 иначе; Race = 1, если белый, 0 иначе). Расставьте эти пять чисел по нужным местам: :
Укажите два способа, которыми можно улучшить следующий отчёт об оценке уравнения множественной регрессии:
| Переменная | t-статистика | p-value |
|---|---|---|
| Variable1 | 2.47 | .02 |
| Variable2 | 1.70 | .09 |
| Variable3 | 6.31 |
Штрафы за превышение скорости в Калифорнии предположительно определяются по формуле, зависящей от того, на сколько миль водитель превысил ограничение скорости, но в отношении различных дополнительных сборов есть гибкость. Исследователь хочет выяснить, выше ли суммарные штрафы за превышение скорости у людей младше 30 лет, чем у более старших водителей.
Задайте уравнение множественной регрессии, которое можно было бы использовать для исследования этого вопроса.
Какие коэффициенты в вашей модели показали бы, есть ли дискриминация в отношении более молодых водителей?
Приведите ситуацию, в которой тест разности средних показал бы дискриминацию в отношении более молодых водителей, а модель множественной регрессии — нет.
Приведите ситуацию, в которой тест разности средних не показал бы дискриминации в отношении более молодых водителей, а модель множественной регрессии показала бы.
Декан утверждает, что зарплаты Y преподавателей гуманитарных дисциплин определяются исключительно педагогическим стажем X. Чтобы выяснить, есть ли статистически убедительная разница в зарплатах преподавателей-мужчин и преподавателей-женщин на гуманитарных факультетах, было оценено уравнение с использованием переменной , если мужчина, 1 если женщина.
Интерпретируйте каждый из параметров и .
Какое преимущество даёт регрессионная модель по сравнению со сравнением средних зарплат мужчин и женщин?
Опишите конкретную ситуацию, в которой сравнение средних зарплат мужчин и женщин показывает дискриминацию в отношении женщин, тогда как регрессионное уравнение — нет.
Опишите конкретную ситуацию, в которой сравнение средних зарплат мужчин и женщин не показывает дискриминации в отношении женщин, тогда как регрессионное уравнение указывает на дискриминацию в отношении женщин.
Исследователя интересовало, как на кассовые сборы фильма влияет возрастной рейтинг Американской ассоциации кинокомпаний (MPAA) и качество фильма, оцененное по опросу десяти известных кинокритиков журнала Entertainment Weekly. Данные по 105 фильмам, получившим оценки критиков в 1991 году, были использованы для оценки следующего уравнения методом наименьших квадратов:
[.61] [4.36] [3.74] где: внутренние кассовые сборы, в долларах возрастной рейтинг MPAA (, если рейтинг G, PG или PG-13; , если рейтинг R) оценка качества Entertainment Weekly [ ]: t-значения Объясните ошибки в каждой из этих трёх критических замечаний:
«Значение R-квадрат 0.214 достаточно близко к нулю, чтобы можно было отвергнуть нулевую гипотезу».
«Коэффициент при имеет неправильный знак, а также слишком велик».
«Низкое t-значение для альфа наводит на мысль, что свободный член может быть незначим. Поэтому, хотя это может быть хорошее исследование фильмов 1991 года, оно может не подходить для прогнозирования фильмов».
Студент оценил регрессионную модель, используя годовые данные с 1990 по 2015 год:
где: потребительские расходы располагаемый доход богатство домохозяйства, всё в миллиардах долларов Первоначальная оценка оказалась статистически незначимой на уровне ; поэтому студент исключил богатство из уравнения, аргументируя это так: «Возможно, между доходом и богатством существовала мультиколлинеарность. Поэтому регрессия точнее без включения богатства». Объясните, почему вы согласны или не согласны с этим рассуждением.
Как бы вы ответили на этот вопрос?
Я столкнулась с проблемой пропущенных значений в своих данных. У некоторых переменных, включая GPA и уровень образования родителей, много пропущенных значений. Если я отброшу тех, у кого есть пропущенные значения, набор данных станет очень маленьким, но если я заменю все пропущенные значения нулями, общий размер выборки составит около 35 000, и я смогу получить статистически значимые результаты.
Определите наиболее серьёзную проблему этой модели дохода домохозяйств
где: средний доход домохозяйства в штате фиктивная переменная штата; 1 для Алабамы, 2 для Аляски, 3 для Аризоны и т. д. средний уровень образования в штате средний возраст в штате
Эта модель была оценена методом наименьших квадратов по данным 2011 года для отдельных лиц:
где: логарифм дохода A = возраст E = образование, лет женщина; 1, если женщина, 0 если мужчина женат/замужем; 1, если состоит в браке, 0 если нет не состоит в браке; 0, если не состоит в браке, 1 если состоит Какую статистическую проблему вы видите?
В 1960 году Мейер Эфроймсон, статистик компании Esso Research and Engineering, предложил пошаговую процедуру выбора объясняющих переменных в модели множественной регрессии из списка переменных-кандидатов, по одной за раз, на основе того, у какой переменной наименьшее p-value. Одна объясняющая переменная выбирается на первом шаге; вторая объясняющая переменная добавляется на втором шаге, и так далее, пока не останется переменных-кандидатов с p-value менее .05. Эта процедура была недавно протестирована на 100 наблюдениях по 50 переменным-кандидатам. Оценённая модель затем использовалась для прогнозирования по 100 дополнительным наблюдениям. Средняя квадратичная ошибка прогнозов составила 348.20 для 100 наблюдений, использованных для оценки модели, и для 100 новых наблюдений. Как бы вы объяснили это расхождение?
Исследователь прокомментировал приведённое ниже оценённое уравнение: «Мультиколлинеарность может быть фактором, на что указывает очень высокая стандартная ошибка и малое -значение».
(): стандартные ошибки [ ]: t-значения
Как мультиколлинеарность влияет на стандартные ошибки и t-значения?
Почему очевидно, что здесь мультиколлинеарность не является проблемой?
Это регрессионное уравнение было оценено по данным для 481 переписного участка Калифорнии, где более населения составляли латиноамериканцы в 2008 году:
где: P = голосов двух главных партий, полученных Бараком Обамой на президентских выборах 2008 года медианный доход домохозяйств латиноамериканцев (в тысячах долларов) , если переписной участок находится в округе Лос-Анджелес; D = 1 иначе и t-значения приведены в скобках. Объясните, почему вы согласны или не согласны с этими выводами:
Доход статистически неубедителен; p-value равно .27, что означает, что существует -я вероятность того, что мы принимаем нулевую гипотезу об отсутствии влияния дохода на голосование латиноамериканцев.
Влияние D на P существенно, потому что t-значение равно 8.42.
В результатах есть ошибка, потому что не может быть настолько низким, если некоторые объясняющие переменные статистически значимы.
Модель была бы лучше, если бы , когда переписной участок находится в округе Лос-Анджелес, и D = 0 иначе.
Случайная выборка из 100 студентов колледжа дала данные о рост студента, пол студента (0, если женщина, 1 если мужчина), рост матери и рост отца. Все значения роста измерены в футах; например, человек ростом 5 футов 3 дюйма имеет рост 5.25 фута.
Объясните, почему следующая интерпретация значения вводит в заблуждение: « роста студента может быть объяснено его полом и ростом его родителей».
Объясните, почему этот вывод вводит в заблуждение: «Пол студента важен для определения роста. В целом мужчины выше женщин, что показывают t-значения».
Показывают ли эти результаты, что рост регрессирует к среднему?
Было оценено уравнение для измерения влияния уровня безработицы и ставки по казначейским облигациям на цены акций :
(): стандартные ошибки
В изучаемый период Федеральная резервная система использовала высокие процентные ставки для ослабления экономики (и снижения инфляции), а затем использовала низкие процентные ставки для стимулирования экономики. Как следствие, уровень безработицы и процентная ставка были сильно положительно коррелированы. Чтобы решить эту проблему мультиколлинеарности, исследователь исключил процентную ставку и получил следующий результат:
Объясните, почему это «лечение» хуже самой проблемы.
Блогер, пишущий о статистическом программном обеспечении Minitab, ответил на вопрос «Как справиться с мультиколлинеарностью?», написав, что «решение может быть относительно простым.... Удалите сильно коррелированные объясняющие переменные из модели.... Поскольку они предоставляют избыточную информацию, удаление одного из коррелированных факторов обычно не приводит к резкому снижению R-квадрата». Как бы вы ответили на это?
Предположим, что процент голосов избирателей за кандидата от партии власти на президентских выборах в США отрицательно связан как с уровнем безработицы, так и с темпом инфляции. Студент узнал на занятии по макроэкономике, что между безработицей и инфляцией существует отрицательная корреляция, и, соответственно, исключил темп инфляции, чтобы избежать проблемы мультиколлинеарности:
Спрогнозируйте эффект этого исключения на оценённый коэффициент при уровне безработицы. Объясните ваши рассуждения так, чтобы новичок мог их понять.
Исследователь использовал данные 2011 года по 30 развивающимся странам для оценки модели реального ВВП на душу населения в долларах США. Шесть переменных образования — это процент людей соответствующего возраста, охваченных обучением в школе; например, процент девочек начального школьного возраста, обучающихся в начальной школе. Показатель подростковой рождаемости — это число рождений на 1000 женщин в возрасте 15-19 лет.
Исследователь первоначально оценил Модель 1. Заметив высокую мультиколлинеарность среди объясняющих переменных, исследователь оценил Модель 2.
Автор пришёл к выводу: «R-квадрат снизился с 0.804 до 0.684. Однако эта модель даёт более точные оценки коэффициентов объясняющих переменных. Стандартные ошибки уменьшились почти вдвое, а t-значения почти для всех переменных, в частности для среднего образования обоих полов, стали статистически значимыми, в отличие от предыдущей модели». Что вы думаете об этом?
В антимонопольном деле против IBM экономист Франклин Фишер оценил уравнения множественной регрессии, объясняющие цены компьютеров как функцию объёма памяти, скорости и других характеристик. t-значения для всех коэффициентов регрессии составляли 20 и выше. Однако эксперт со стороны государства Алан К. Макадамс утверждал, что мультиколлинеарность среди объясняющих переменных делает невозможным сделать надёжные выводы о влиянии различных объясняющих переменных на цены компьютеров. Объясните, почему вы согласны или не согласны с логикой Макадамса.
Модель множественной регрессии использовалась для оценки связи между зарплатой игрока Главной лиги бейсбола (MLB) и его средним показателем отбивания и числом хоум-ранов:
| Среднее | Стандартное отклонение | |
|---|---|---|
| S = годовая зарплата, миллионы долларов | 2.5 | 3.5 |
| B = средний показатель отбивания за сезон | .263 | .032 |
| число хоум-ранов за сезон | 12.5 | 10.4 |
Можем ли мы заключить из этих результатов, что на зарплату сильнее влияет средний показатель отбивания, чем число хоум-ранов, или наоборот? Объясните ваши рассуждения.
Интерпретируйте эти результаты регрессии, использующие квартальные данные за 1974-2014 годы. Зависимая переменная — число новостроек, начатых строительством, в тысячах. Объясняющие переменные: Time в первом квартале 1974 года, 2 во втором квартале 1974 года и т.д. Q2 = 1 во втором квартале, 0 иначе Q3 = 1 в третьем квартале, 0 иначе Q4 = 1 в четвёртом квартале, 0 иначе
Данные по 100 гольфистам с наибольшим призовым выигрышем на туре Ассоциации профессионального гольфа (PGA) 1993 года использовались для оценки следующего уравнения:
| {} | {} | {} | {} | {} | {} |
где: Y = выигранные доллары D = средняя дальность удара с ти, ярды A = точность удара с ти (процент ударов, попадающих в фервей) G = процент грин, достигнутых числом ударов на два меньше пара процент грин из указанных выше (пар минус два), достигнутых после которых потребовался только один патт процент случаев, когда игрок делал пар после попадания в песчаную ловушку Стандартные ошибки приведены в скобках; t-значения — в квадратных скобках; и .
Какие из коэффициентов при объясняющих переменных статистически значимы на уровне ?
У каких, если таковые есть, из оценённых коэффициентов при объясняющих переменных правдоподобные знаки?
Как свободный член может быть отрицательным, если Y не может быть отрицательным?
Означает ли тот факт, что коэффициент при P больше коэффициента при D, что при прочих равных игрок, хорошо владеющий паттом, выиграет больше денег, чем игрок с дальними ударами с ти? Объясните.
Означает ли тот факт, что t-значение для коэффициента при D больше t-значения для коэффициента при S, что при прочих равных игрок с дальними ударами с ти выиграет больше денег, чем игрок, лучше умеющий делать пар из песчаных ловушек? Объясните.
Уравнение множественной регрессии использовалось для объяснения арендной платы, выплачиваемой людьми, которые живут и работают в Финиксе:
где: месячная арендная плата X = месячный доход , если работа на полную ставку, 0 если на неполную Объясните, почему вы согласны или не согласны с такой интерпретацией : «Коэффициент при фиктивной переменной измеряет то, в какой мере арендаторы могут позволить себе платить более высокую арендную плату благодаря тому, что работа на полную ставку даёт им больший доход».
Опрос 47 второкурсников колледжа исследовал влияние учёбы и внеучебной деятельности на оценки:
где: средний балл по 12-балльной шкале среднее число часов в неделю, потраченных на учёбу; , если человек тратит не менее 10 часов в неделю на внеучебную деятельность, такую как работа или спорт, 0 иначе и стандартные ошибки приведены в скобках. Исследователь пришёл к выводу, что «эффект внеучебной деятельности незначим и не подтверждает широко распространённое представление о том, что внеучебная деятельность отрицательно влияет на оценки, поскольку сокращает время, доступное для учёбы». Объясните, почему коэффициент при D не измеряет то, насколько внеучебная деятельность влияет на оценки за счёт сокращения времени, доступного для учёбы.
Исследователь задал следующую модель временных рядов потребительских расходов:
где: C = потребительские расходы располагаемый доход , если в этот год фондовый рынок вырос, 0 иначе Какие ошибки вы видите в этих отчётных результатах?
для теста .
Значение должно быть положительным, потому что когда доход растёт, фондовый рынок обычно тоже растёт.
Для и двустороннее p-value равно .95.
.
Оценка равна 1.13.
Что самое важное неверно в этих результатах множественной регрессии, изучавшей связь между курсом обучения в колледже и психической депрессией?
Зависимая переменная: Depression = данные опроса, измеренные по шкале 0-10 Объясняющие переменные: Frosh = 1, если первый курс, 0 иначе Sophomore , если второй курс, 0 иначе Junior = 1, если третий курс, 0 иначе Senior = 1, если четвёртый курс или дольше, 0 иначе Результаты
| Константа | 4.720*** (1.664) |
|---|---|
| Frosh | .669 (.818) |
| Sophomore | .802 (.850) |
| Junior | .923 (.838) |
| Senior | .819 (.814) |
| Наблюдений | 113 |
| R-квадрат | .531 |
| Стандартные ошибки в скобках |
В чём проблемы этих утверждений?
«У меня есть данные по 11 возможным объясняющим переменным для моей модели множественной регрессии. Я использую три переменные с наибольшими t-значениями».
Высокий R-квадрат показывает, что все эти объясняющие переменные оказывают большое влияние на Y.
«Поскольку p-value для коэффициента при доходе равно 0.0000000427, мы очень уверены, что вероятность истинности нулевой гипотезы составляет менее ».
«Есть проблема мультиколлинеарности: объясняющие переменные коррелируют друг с другом, но модель множественной регрессии предполагает, что объясняющие переменные независимы».