17.8

Множественная регрессия

[16/0%]
LaTeX
Задача 17.8.1

Попросите 100 случайно выбранных студентов записать свой пол, средний балл, порядок рождения (первый ребёнок или единственный, средний ребёнок или последний ребёнок) и рост. Теперь оцените модель множественной регрессии со средним баллом в качестве зависимой переменной и полом, порядком рождения и ростом в качестве объясняющих переменных.

?
Задача 17.8.2

Постройте правдоподобную модель множественной регрессии для предсказания зарплаты за первый год работы выпускников колледжа, ищущих работу. Теперь с помощью случайного опроса соберите данные об их ожидаемой зарплате (или фактической зарплате, если у них уже есть работа) и о ваших объясняющих переменных, и оцените параметры своей модели методом наименьших квадратов.

?
Задача 17.8.3

Используйте RealEstate.com, ZipRealty.com, Zillow.com или аналогичный сайт, чтобы найти цены на дома, выставленные на продажу в вашем родном городе или там, где вы планируете жить в будущем. Задайте правдоподобную модель множественной регрессии для объяснения этих цен и используйте случайную выборку как минимум из 60 домов, чтобы оценить параметры своей модели.

?
Задача 17.8.4

Выберите модель и год выпуска автомобиля (например, Camry 2020 года) и оцените правдоподобную модель множественной регрессии для предсказания цен подержанных автомобилей.

?
Задача 17.8.5

Используйте данные нескольких президентских выборов, чтобы оценить модель множественной регрессии, где Y=\mathrm{Y}= процент голосов двух партий за президента США, полученных кандидатом от партии действующего президента, X1=\mathrm{X}1= процент голосов двух партий за президента США, полученных кандидатом от партии действующего президента на предыдущих президентских выборах, а X2 == процентное изменение реального располагаемого дохода за последний год пребывания у власти партии действующего президента. Например, на выборах 2020 года Дональд Трамп (республиканец) был действующим президентом, поэтому Y — это процент голосов двух партий 2020 года, полученных кандидатом-республиканцем; X1 — это процент голосов двух партий 2016 года, полученных кандидатом-республиканцем; а X2 — это процентное изменение реального располагаемого дохода в 2020 году. Являются ли коэффициенты обеих объясняющих переменных статистически убедительными и существенными? Какие выборы выглядят как выбросы или аномалии?

?
Задача 17.8.6

Используйте данные по каждому из 50 штатов за одни президентские выборы, чтобы оценить модель множественной регрессии, где Y=\mathrm{Y}= процент голосов двух партий за президента США, полученных в этом штате в этот год выборов кандидатом от партии действующего президента, X1=\mathrm{X}1= процент голосов двух партий за президента США, полученных в этом штате кандидатом от партии действующего президента на предыдущих президентских выборах, а X2 == процентное изменение уровня безработицы в этом штате за последний год пребывания у власти партии действующего президента. Например, на выборах 2020 года Дональд Трамп (республиканец) был действующим президентом, поэтому Y для Айовы в 2020 году — это процент голосов двух партий в Айове, полученных кандидатом-республиканцем; X1 — это процент голосов двух партий в Айове в 2016 году, полученных кандидатом-республиканцем; а X2 — это процентное изменение уровня безработицы в Айове в 2020 году. Являются ли коэффициенты обеих объясняющих переменных статистически убедительными и существенными? Какие штаты выглядят как выбросы или аномалии?

?
Задача 17.8.7

Соберите ежедневные данные за два последних года для Y=\mathrm{Y}= процентного изменения цены индекса SP 500 и для 100 объясняющих переменных, каждая из которых равна ежедневной разнице между максимальной и минимальной температурой в 100 разных городах. Используйте данные за первый год, чтобы оценить 100 моделей простой регрессии, каждая из которых использует одну из ваших 100 объясняющих переменных. Определите пять городов с наивысшими t-значениями и оцените модель множественной регрессии, используя в качестве объясняющих переменных только эти пять городов. Наконец, используйте оценённые коэффициенты модели множественной регрессии, оценённой на данных первого года, чтобы предсказать ежедневные процентные изменения цены SP 500 в течение второго года. Каков ваш вывод?

?
Задача 17.8.8

Соберите ежедневные данные за два последних года для Y=\mathrm{Y}= процентного изменения цены индекса SP 500 и для 100 объясняющих переменных, ежедневное значение каждой из которых равно случайно сгенерированному числу. Используйте данные за первый год, чтобы оценить 100 моделей простой регрессии, каждая из которых использует одну из ваших 100 объясняющих переменных. Определите пять переменных с наивысшими t-значениями и оцените модель множественной регрессии, используя только эти пять объясняющих переменных. Наконец, используйте оценённые коэффициенты модели множественной регрессии, оценённой на данных первого года, чтобы предсказать ежедневные процентные изменения цены SP 500 в течение второго года. Каков ваш вывод?

?
Задача 17.8.9

Используйте генератор случайных чисел, чтобы создать 500 наблюдений для 101 переменной. Пусть первая случайная переменная будет Y — переменной, которую вы хотите предсказать, а остальные 100 переменных — потенциальными объясняющими переменными, которые будут использоваться для предсказания Y. Используйте первые 250 наблюдений, чтобы оценить модель множественной регрессии, используя все 100 объясняющих переменных для предсказания Y. (В качестве альтернативы можно оценить 5 моделей по 20 объясняющих переменных в каждой.) Определите пять объясняющих переменных с наивысшими t-значениями. Заново оцените свою модель множественной регрессии, используя эти 5 объясняющих переменных и первые 250 наблюдений, для предсказания Y.

Теперь используйте оценённые коэффициенты второй модели множественной регрессии, оценённой на первых 250 наблюдениях, чтобы предсказать значения Y для вторых 250 наблюдений. Каков ваш вывод?

?
Задача 17.8.10

Выберите 10-летний период, например 2015-2024 годы. Оцените модель множественной регрессии, используя следующие четыре объясняющие переменные, все зафиксированные за год до Супербоула, чтобы предсказать разность счёта Супербоула (счёт команды AFC минус счёт команды NFC) за первые 5 лет ваших данных:

Максимальная температура в Лондоне 30 июня Значение индекса Доу-Джонса 30 июня Среднее число букв в именах лауреата(ов) Нобелевской премии по физике этого года Число очков, набранных футбольным клубом, выигравшим Премьер-лигу в сезоне, закончившемся в мае того года

Насколько хорошо ваша модель, оценённая по первым 5 годам, предсказывает разность счёта Супербоула за последние 5 лет ваших данных? Каков ваш вывод?

?
Задача 17.8.11

Используйте модель множественной регрессии, где максимальные температуры в день выборов в этих десяти городах служат объясняющими переменными для предсказания процента голосов кандидата от Демократической партии от общего числа голосов двух партий за президента на 11 президентских выборах 1980-2020 годов: Клермонт, Калифорния; Бозман, Монтана; Брокен-Боу, Небраска; Берлингтон, Вермонт; Карибу, Мэн; Коди, Вайоминг; Довер, Делавэр; Элкинс, Западная Вирджиния; Фарго, Северная Дакота; и Покателло, Айдахо. Теперь используйте свою оценённую модель, чтобы предсказать процент голосов кандидата от Демократической партии от общего числа голосов двух партий за президента в 2024 году. Каков ваш вывод?

?
Задача 17.8.12

На этом сайте https://www.spotrac.com/epl/payroll/ представлены данные о фондах заработной платы клубов английской Премьер-лиги (АПЛ) в разбивке по нападающим, полузащитникам, защитникам и вратарям. Рассматривая последний завершившийся сезон, насколько хорошо результаты клуба предсказываются фондом заработной платы в этих четырёх категориях?

?
Задача 17.8.13

На этом сайте <https://www.premierleague.com/stats/top/clubs/ wins?se=489> представлены данные о победах клубов английской Премьер-лиги (АПЛ), красных и жёлтых карточках. Рассматривая последний завершившийся сезон, насколько хорошо результаты клуба предсказываются числом красных и жёлтых карточек?

?
Задача 17.8.14

Что лучше предсказывает будущие процентные ставки — текущие процентные ставки или текущий темп инфляции? Используйте годовые данные для оценки модели R=α+β1S+β2P+εR=\alpha +\beta_{1} S+\beta_{2} P+\varepsilon, где RR — процентная ставка по 1-летним казначейским облигациям, SS — процентная ставка в предыдущем году, а PP — годовой темп инфляции в предыдущем году.

?
Задача 17.8.15

На этом сайте <https://www.multpl.com/s-p-500-historical-prices/ table/by-year > представлены данные об индексе SP 500 на 1 января каждого года начиная с 1871 года. На этом сайте <https://www.multpl.com/s-p-500-earnings-yield > представлены данные о доходности по прибыли индекса SP 500 на 1 января каждого года начиная с 1871 года. На этом сайте <https://www. multpl.com/s-p-500-dividend-yield/table/by-year> представлены данные о дивидендной доходности индекса SP 500 на 31 декабря каждого года начиная с 1871 года. Насколько хорошо процентное изменение SP 500 за год предсказывается доходностью по прибыли и дивидендной доходностью на начало этого года?

?
Задача 17.8.16

Постройте и оцените модель для предсказания числа медалей, которые страна выигрывает на летних Олимпийских играх. В качестве объясняющих переменных можно включить население страны и доход на душу населения. Добавьте другие переменные, которые, по вашему мнению, важны. Определите страны, которые, согласно вашей модели, показывают результаты хуже или лучше ожидаемых.

?