Тема 4

Данные и статистические выводы

Как по данным принимать решения: среднее, медиана и разброс, выборка и доверительный интервал, A/B-тест и p-значение, корреляция и регрессия, и почему связь в данных ещё не причина. Всё на реальных объявлениях об аренде квартир в Москве.

Сколько платить за аренду

Весной 2021 года компания переводит в Москву двадцать руководителей с семьями и будет оплачивать им аренду жилья. Директору по персоналу нужно назначить месячную компенсацию. Под рукой реальные данные: 1465 объявлений об аренде квартир, опубликованных на ЦИАН в марте 2021 года.

Каждое объявление — это наблюдение (observation), строка таблицы. У каждого есть переменные (variables), столбцы таблицы: месячная аренда в тысячах рублей, площадь, возраст дома, этаж, тип дома, есть ли балкон. Переменные бывают двух видов. Численные (numerical) выражают количество, и с ними имеют смысл сложение и среднее: аренда, площадь, возраст. Категориальные (categorical) делят наблюдения на группы: тип дома (монолит, кирпич, панель, другой), наличие балкона. В таблице их часто кодируют нулями и единицами, но среднее «типа дома» смысла не имеет.

Средняя аренда в наборе 242,5 тыс. ₽ в месяц, медиана 200 тыс. ₽.

Вопрос

Если назначить компенсацию на уровне средней аренды, 242,5 тыс. ₽, на какую долю объявлений её хватит?

Варианты ответа

Среднее, медиана, разброс

Среднее и медиана

Идея. Среднее (mean) — сумма значений, делённая на их число. Медиана (median) — значение посередине, если выстроить все наблюдения по возрастанию: половина не больше её, половина не меньше.

Обозначения. Для наблюдений \(x_1, \dots, x_n\)

\[\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i.\]

В Excel: СРЗНАЧ (AVERAGE) и МЕДИАНА (MEDIAN).

Пример. Пять квартир сдаются за 60, 70, 80, 90 и 450 тыс. ₽. Среднее \((60 + 70 + 80 + 90 + 450)/5 = 150\), медиана 80. Одна дорогая квартира сдвинула среднее почти вдвое, а медиану не сдвинула.

Проверьте себя. Если пятая квартира подешевеет до 100, чему станут равны среднее и медиана? (80 и 80.)

Распределение, у которого длинный «хвост» уходит вправо, называют скошенным вправо (right-skewed). В бизнесе таких много: размер чека в супермаркете, число подписчиков, оценки стартапов, выручка с клиента за всё время. У них среднее заметно выше медианы. В наборе ЦИАН сильнее всего скошен возраст дома: средний 31,6 года, медианный 16 лет. Большинство домов новые, но есть и дома по 100–145 лет.

Какой показатель брать, зависит от вопроса. «Сколько стоит обычная квартира» лучше описывает медиана. А бюджет на всех двадцать руководителей считают по среднему: сумма платежей равна среднему, умноженному на число людей, и дорогие квартиры в ней участвуют.

Разброс: размах, стандартное отклонение, процентили

Размах (range) — разница между наибольшим и наименьшим значением: МАКС(...) − МИН(...). Он зависит только от двух крайних наблюдений.

Стандартное отклонение (standard deviation) в данных считают так же, как в теме 3, только вместо вероятностей у каждого наблюдения одинаковый вес. Делят на \(n - 1\), а не на \(n\): так оценка по выборке в среднем не занижает разброс.

\[s = \sqrt{\frac{1}{n - 1}\sum_{i=1}^{n} (x_i - \bar{x})^2}.\]

В Excel: СТАНДОТКЛОН.В (STDEV.S).

Процентиль (percentile): \(k\)-й процентиль — значение, ниже которого лежит \(k\%\) наблюдений. Медиана — 50-й процентиль, 25-й и 75-й называют квартилями. В Excel: ПРОЦЕНТИЛЬ.ВКЛ (PERCENTILE.INC).

Пример. Площадь квартир в наборе: среднее 122,7 м², медиана 110 м², стандартное отклонение 71,5 м². В интервал «среднее ± одно стандартное отклонение», от 51 до 194 м², попадает 70% квартир: близко к 68% для нормального распределения из темы 3, хотя площадь скошена.

Проверьте себя. У трёх квартир аренда 4, 6 и 8 условных единиц. Каково стандартное отклонение? (Отклонения −2, 0, 2; \(s = \sqrt{8/2} = 2\).)

Симуляция

Гистограмма показывает, сколько объявлений приходится на каждый интервал аренды. Переключайте переменную, чтобы увидеть площадь и возраст дома. Нажмите «Убрать 5% самых дорогих» и посмотрите, как далеко сдвинутся среднее и медиана. Затем решите задачу: компенсации должно хватать на три четверти объявлений. Поставьте порог и нажмите «Проверить».

Три четверти объявлений покрывает порог чуть ниже 350 тыс. ₽: это 75-й процентиль, или верхний квартиль. Ровно 350 тыс. просит сразу 71 объявление, поэтому с порогом 350 компенсации хватит уже на 79,5%. В данных с круглыми ценами процентили упираются в такие «ступеньки», и это стоит учитывать, когда назначаете лимит. Медиана, 200 тыс., покрывает половину объявлений, среднее 58%.

Кнопка «Убрать 5% самых дорогих» показывает, почему медиану называют устойчивой. Без 73 самых дорогих объявлений среднее падает с 242,5 до 216,5 тыс. ₽, а медиана только с 200 до 190. Стандартное отклонение сжимается с 183 до 146: оно чувствительно к крайним значениям, потому что отклонения возводятся в квадрат.

Главное

Медиана описывает типичное наблюдение и устойчива к крайним значениям, среднее нужно для сумм и бюджетов. Разброс описывают стандартным отклонением и процентилями. Сначала посмотрите на гистограмму, потом выбирайте число.

Проверьте себя

Средний чек пяти покупателей в магазине: 800, 900, 1000, 1100 и 9200 ₽. На сколько рублей среднее больше медианы?

₽

За четыре недели кофейня продала 50, 54, 46 и 50 тортов. Каково выборочное стандартное отклонение недельных продаж? Округлите до сотых.

В таблице объявлений есть столбцы «аренда», «площадь», «возраст дома» и «тип дома» (1 означает монолит, 2 кирпич, 3 панель, 4 другой). Для какого столбца среднее не имеет смысла?

Варианты ответа

Компания оплачивает аренду 40 сотрудникам, каждый выбирает квартиру сам, и цены выбранных квартир распределены как в объявлениях. Какой показатель нужен, чтобы оценить годовой бюджет на всех?

Варианты ответа

Пятьдесят объявлений и вся Москва

Представьте, что у аналитика нет всех 1465 объявлений, а есть только первые 50. Средняя аренда по ним 205 тыс. ₽. Если добавить ещё 50, среднее станет 232 тыс., по первым 200 объявлениям 238 тыс., по 800 объявлениям 246 тыс. Число скачет, и руководитель спрашивает: сколько данных нужно, чтобы ему можно было доверять?

Все объекты, о которых мы хотим знать, называют генеральной совокупностью (population): здесь это все квартиры такого класса, сдающиеся в Москве. Те, что мы видели, — выборка (sample). Среднее по выборке, выборочное среднее, — оценка неизвестного среднего генеральной совокупности. Другая выборка дала бы другое число.

Вопрос

Аналитик хочет, чтобы оценка средней аренды колебалась от выборки к выборке вдвое меньше. Во сколько раз больше объявлений ему нужно собрать?

Варианты ответа

Стандартная ошибка и доверительный интервал

Стандартная ошибка

Идея. Выборочное среднее случайно: оно зависит от того, какие объявления попали в выборку. Его разброс от выборки к выборке называют стандартной ошибкой (standard error, SE). Это тот же \(\sigma/\sqrt{n}\) из темы 3, только неизвестное \(\sigma\) заменяют выборочным \(s\).

Обозначения.

\[SE = \frac{s}{\sqrt{n}}.\]

Пример. По первым 50 объявлениям \(s = 170{,}1\) тыс. ₽, поэтому \(SE = 170{,}1/\sqrt{50} \approx 24{,}1\) тыс. ₽.

Проверьте себя. Какой была бы стандартная ошибка при том же \(s\) и 200 объявлениях? (\(170{,}1/\sqrt{200} \approx 12{,}0\).)

Доверительный интервал

Идея. Выборочное среднее почти никогда не совпадает с истинным, но редко отходит от него больше чем на две стандартные ошибки. Интервал «среднее ± около двух стандартных ошибок» называют 95%-м доверительным интервалом (confidence interval).

Обозначения.

\[\bar{x} \pm t \cdot \frac{s}{\sqrt{n}},\]

где множитель \(t\) около 2: для больших выборок 1,96, для \(n = 50\) он 2,01 (его дает распределение Стьюдента, которое учитывает, что \(s\) тоже оценка). В Excel половину ширины интервала дают ДОВЕРИТ.СТЬЮДЕНТ(0,05; s; n) (CONFIDENCE.T) или, для больших выборок, ДОВЕРИТ.НОРМ (CONFIDENCE.NORM).

Пример. Первые 50 объявлений:

\[205{,}0 \pm 2{,}01 \cdot 24{,}1 \;\Rightarrow\; \text{от } 156{,}6 \text{ до } 253{,}3 \text{ тыс. ₽}.\]

Как читать. «95%» относится к способу построения: если много раз брать случайные выборки и строить по ним интервалы, около 95% интервалов накроют истинное среднее. Конкретный интервал либо накрыл его, либо нет. Чем выше требуемый уровень доверия, тем шире интервал.

Проверьте себя. Каков интервал по всем 1465 объявлениям, если \(s = 183{,}2\)? (\(242{,}5 \pm 1{,}96 \cdot 4{,}79\): от 233,1 до 251,9.)

Сколько данных собрать, можно решить заранее. Если нужен интервал не шире \(\pm E\), а разброс примерно известен, \(n = (1{,}96\,\sigma/E)^2\).

Симуляция

Представим, что 1465 объявлений составляют весь рынок; тогда истинное среднее известно, 242,5 тыс. ₽. Берите случайные выборки разного размера и смотрите, сколько интервалов из 100 накрывает истинное среднее. Сравните способы отбора «первые n строк» и «только монолитные дома». Затем решите задачу: сколько объявлений нужно, чтобы интервал был не шире ±20 тыс. ₽ при стандартном отклонении 183,2?

При случайном отборе около 95 интервалов из 100 накрывают истинное среднее: маленькие выборки дают широкие интервалы, большие узкие. Отклонения от 95% есть с обоих краёв. В выборках из 5–10 объявлений накрывает чуть меньше, потому что аренда скошена. Когда выборка составляет заметную долю всех 1465 объявлений, накрывает больше: формула \(s/\sqrt{n}\) рассчитана на рынок, который намного больше выборки. Для точности ±20 тыс. ₽ нужно \((1{,}96 \cdot 183{,}2/20)^2 \approx 322{,}3\), то есть 323 объявления.

Отбор «только монолитные дома» показывает другую беду. Среднее по монолитам 278 тыс. ₽, и интервалы стабильно промахиваются. Больше данных не помогает: интервал сужается вокруг неверного значения. Выборку, которая систематически отличается от генеральной совокупности, называют смещённой (biased). Случайный отбор защищает от смещения, но не от случайной ошибки: её и измеряет доверительный интервал. Первые строки файла годятся вместо случайной выборки, только если порядок строк не связан с ценой. В этом наборе он почти не связан, и первые 50 объявлений дали 205 тыс. ₽ просто по случайности: это полторы стандартные ошибки от истинных 242,5.

Сам набор ЦИАН — тоже выборка, и не случайная из всех московских квартир: средняя площадь в нём 123 м², в нём много больших дорогих квартир. Для компенсации руководителям он подходит, а о «средней московской аренде» по нему судить нельзя.

Главное

Выборочное среднее колеблется со стандартной ошибкой \(s/\sqrt{n}\), и 95%-й интервал \(\bar{x} \pm 1{,}96\,s/\sqrt{n}\) это колебание показывает. Вдвое более узкий интервал требует вчетверо больше данных. От смещённого отбора объём выборки не спасает.

Проверьте себя

По 81 объявлению стандартное отклонение аренды равно 180 тыс. ₽. Какова стандартная ошибка средней аренды?

тыс. ₽

По 400 объявлениям средняя аренда 250 тыс. ₽, стандартное отклонение 200 тыс. ₽. Найдите верхнюю границу 95%-го доверительного интервала (множитель 1,96).

тыс. ₽

Сеть кофеен хочет оценить средний чек с точностью ±5 ₽ (95%-й интервал). По прошлым данным стандартное отклонение чека около 50 ₽. Сколько чеков нужно в выборке? Используйте множитель 1,96 и округлите вверх.

чеков

Чтобы оценить среднюю аренду, агентство опросило 3000 подписчиков своего канала о премиальной недвижимости. Интервал получился узким: ±4 тыс. ₽. Как к нему относиться?

Варианты ответа

Новый тренинг помог?

Компания хочет заменить вводный тренинг для новых сотрудников иммерсивным курсом-симуляцией. Чтобы проверить, работает ли он, новичков одного набора случайно разделили на две группы по 35 человек. Контрольная группа (control group) прошла старый тренинг, тестовая (treatment group) новый. Через полгода клиенты оценили работу каждого по 10-балльной шкале. Средняя оценка в контрольной группе 4,8, в тестовой 5,7; стандартное отклонение оценок в обеих 2,1 балла.

Учебные цифры

Данные эксперимента учебные: 35 + 35 оценок со средними 4,8 и 5,7 и стандартным отклонением 2,1.

Вопрос

Разница средних 0,9 балла. Что ещё нужно знать, чтобы понять, не случайна ли она?

Варианты ответа

Проверка гипотезы

Стандартная ошибка разницы

Идея. Разница средних двух независимых групп тоже случайна. Дисперсии независимых величин складываются (тема 3), поэтому

\[SE_{\text{разницы}} = \sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}.\]

Пример.

\[SE = \sqrt{\frac{2{,}1^2}{35} + \frac{2{,}1^2}{35}} = 2{,}1\sqrt{\frac{2}{35}} \approx 0{,}50, \qquad t = \frac{5{,}7 - 4{,}8}{0{,}50} \approx 1{,}79.\]

Число \(t\) показывает, во сколько стандартных ошибок укладывается разница.

Проверка гипотезы (hypothesis testing) идёт в три шага.

  1. Сформулировать гипотезы до того, как смотреть на результат. Нулевая гипотеза (null hypothesis, \(H_0\)): тренинги одинаково эффективны. Альтернативная гипотеза (\(H_1\)): новый лучше (односторонняя альтернатива) или тренинги различаются в любую сторону (двусторонняя).
  2. Посчитать p-значение.
  3. Сделать вывод. Если p-значение меньше заранее выбранного порога, обычно 0,05, нулевую гипотезу отвергают и говорят, что разница статистически значима (statistically significant) на уровне 5%. Если нет, нулевую гипотезу не отвергают. Это не то же самое, что принять её.

p-значение

Определение. p-значение (p-value) — вероятность получить разницу не меньше наблюдаемой, если на самом деле эффекта нет. Для двусторонней альтернативы считают отклонения в обе стороны, для односторонней только в одну.

Пример. При \(t = 1{,}79\) и 68 степенях свободы двустороннее p-значение 0,077, одностороннее 0,039. В Excel: СТЬЮДЕНТ.ТЕСТ(контроль; тест; хвосты; тип) (T.TEST), где «хвосты» — 1 или 2, а «тип» 3 означает, что дисперсии групп могут различаться.

Чем p-значение не является. Это не вероятность того, что эффекта нет, и не вероятность того, что разница «случайна». Оно отвечает на обратный вопрос: насколько удивительны данные, если эффекта нет. (Та же ловушка, что \(P(E \mid H)\) и \(P(H \mid E)\) в теме 3.)

Обратите внимание на развилку. Если заранее было решено проверять «новый лучше», \(p = 0{,}039 < 0{,}05\), и эффект значим. Если «тренинги различаются», \(p = 0{,}077\), и не значим. Выбирать альтернативу после того, как увидели данные, нельзя: это способ получить значимость там, где её нет.

Симуляция

Наверху ваш эксперимент: переключите альтернативу и посмотрите, как меняется вывод. Ниже лаборатория: задайте истинный эффект и число людей в группах и проведите 1000 экспериментов. При нулевом эффекте посмотрите, как часто разница всё равно выходит «значимой». Затем решите задачу: сколько сотрудников нужно в каждой группе, чтобы эксперимент находил эффект 0,9 балла в 80% случаев?

Лаборатория показывает две ошибки, которые возможны в любой проверке. Если эффекта нет, около 5% экспериментов всё равно дают \(p < 0{,}05\): это ложные срабатывания, и порог 0,05 задаёт их долю. Если эффект 0,9 балла есть, эксперимент с 35 людьми в группе находит его только в 43% случаев. Долю найденных реальных эффектов называют мощностью (power). Для мощности 80% нужно около 86 человек в группе. Эксперимент на 35 + 35 с самого начала был слишком мал, чтобы надёжно заметить такой эффект.

Отсюда правила чтения результатов.

  • «Незначимо» не значит «эффекта нет». 95%-й интервал для разницы от −0,1 до 1,9 балла: данные совместимы и с нулевым эффектом, и с очень большим. Честный вывод: «пока не знаем», а следующий шаг — эксперимент побольше.
  • «Значимо» не значит «важно». При огромной выборке значимой становится и ничтожная разница. Решение зависит от размера эффекта и его ценности для бизнеса, а не только от p.
  • Пересечение интервалов — не проверка. 95%-е интервалы двух групп могут слегка пересекаться, а разница всё равно быть значимой: проверять нужно саму разницу.
  • Много проверок — много ложных находок. Если сравнить 20 вариантов рекламы, у которых эффекта нет, в среднем один окажется «значимым» на уровне 5%.

Аренда в монолитных и кирпичных домах

В наборе ЦИАН 874 квартиры в монолитных домах сдаются в среднем за 278,1 тыс. ₽, 405 квартир в кирпичных за 227,0 тыс. Разница 51 тыс. ₽ при стандартной ошибке около 10: \(t \approx 5{,}1\), p-значение меньше 0,001. Случайностью такую разницу не объяснить. Но почему монолиты дороже, сама проверка не говорит: может быть, дело в самих домах, а может быть, в том, что монолитные дома новее, а квартиры в них больше. Об этом раздел 5.

Главное

p-значение — вероятность увидеть такую же или большую разницу, если эффекта нет. Решайте до эксперимента, что проверяете и сколько нужно данных; «незначимо» означает «данных не хватило», а не «эффекта нет».

Проверьте себя

В A/B-тесте два варианта страницы показали по 100 посетителям. Средняя длительность визита 52 и 55 секунд, стандартное отклонение в обеих группах 10 секунд. Чему равно \(t\), отношение разницы средних к её стандартной ошибке? Округлите до сотых.

Тест новой упаковки показал рост продаж с p-значением 0,03. Что это означает?

Варианты ответа

Средняя аренда в двух районах 100 и 130 тыс. ₽, стандартная ошибка каждого среднего 9 тыс. ₽. Их 95%-е интервалы (от 82,4 до 117,6 и от 112,4 до 147,6) пересекаются. Чему равно \(t\) для разницы средних? Округлите до сотых.

Пилотный запуск программы лояльности в 40 магазинах дал прирост выручки 3% с p-значением 0,12. Что разумнее всего сказать совету директоров?

Варианты ответа

Площадь и цена

Агентство по переезду хочет простое правило: сколько в Москве стоит аренда квартиры данной площади. Заодно оно ищет объявления, которые дороже или дешевле обычного для своего размера. На диаграмме рассеяния (scatter plot) каждая точка — одно объявление: по горизонтали площадь, по вертикали аренда.

Вопрос

Коэффициент корреляции площади и аренды равен 0,78. Что это значит?

Варианты ответа

Корреляция и линия регрессии

Коэффициент корреляции

Идея. Коэффициент корреляции \(r\) (correlation coefficient) от −1 до 1 показывает, насколько тесно две переменные связаны линейно. При \(r = 1\) все точки лежат на восходящей прямой, при \(r = -1\) на нисходящей, при \(r\) около нуля линейной связи нет.

Оговорки. Нулевая корреляция не означает, что связи нет совсем: зависимость в форме холма даёт \(r \approx 0\). Одна далёкая точка может сильно изменить \(r\). И корреляция не говорит, что чем вызвано. В Excel: КОРРЕЛ (CORREL).

Пример. Площадь и аренда: \(r = 0{,}78\). Возраст дома и аренда: \(r = -0{,}05\), линейной связи почти нет. Ниже вы увидите, что связь при этом есть, только не прямая.

Линия регрессии

Идея. Линия регрессии (regression line) — прямая \(\hat{y} = a + b\,x\), которая ближе всех к точкам в смысле наименьших квадратов: сумма квадратов вертикальных отклонений точек от неё наименьшая. Отклонение \(y - \hat{y}\) называют остатком (residual).

Обозначения. \(y\) — зависимая переменная (dependent variable), здесь аренда; \(x\) — объясняющая (explanatory), здесь площадь; \(b\) — коэффициент регрессии, наклон; \(a\) — пересечение с осью (тема 1). В Excel: НАКЛОН (SLOPE), ОТРЕЗОК (INTERCEPT), ЛИНЕЙН (LINEST).

Пример. По всем 1465 объявлениям

\[\widehat{\text{аренда}} = -1{,}12 + 1{,}99 \cdot \text{площадь}.\]

Квартира на 1 м² больше в среднем сдаётся на 1,99 тыс. ₽ дороже. Квартира 88 м² по линии должна стоить \(-1{,}12 + 1{,}99 \cdot 88 \approx 173{,}7\) тыс. ₽; третья строка набора, 88 м² за 180 тыс., имеет остаток \(180 - 173{,}7 = +6{,}3\).

Проверьте себя. Какой прогноз для 150 м²? (\(-1{,}12 + 1{,}99 \cdot 150 \approx 297{,}4\) тыс. ₽.)

Симуляция

Перед вами 40 объявлений из набора. Перетаскивайте две точки на прямой и включите «Показать квадраты остатков»: метод наименьших квадратов делает общую площадь квадратов как можно меньше. Найдите такую прямую и нажмите «Проверить». Затем переключитесь на все 1465 объявлений и сравните площадь с возрастом дома.

Линия, которую вы нашли руками, почти совпала с линией наименьших квадратов. На всех данных видно и то, чего линия не говорит: разброс вокруг неё велик, и чем больше квартира, тем он больше.

Сколько объясняет линия

R²

Идея. \(R^2\) (коэффициент детерминации) показывает, какую долю разброса \(y\) объясняет линия: \(R^2 = 1 - \frac{\text{сумма квадратов остатков}}{\text{сумма квадратов отклонений } y \text{ от среднего}}\). От 0 (линия объясняет не больше, чем просто среднее) до 1 (все точки на линии). Для регрессии на одну переменную \(R^2 = r^2\).

Пример. Площадь: \(R^2 = 0{,}60\) (\(0{,}78^2\)). Возраст дома: \(R^2 = 0{,}003\).

С возрастом дома две тонкости. Первая: наклон −0,28 тыс. ₽ за год формально значим (p-значение 0,039), потому что 1465 наблюдений позволяют различить даже очень слабую линейную связь. Но прямая по возрасту объясняет 0,3% различий в аренде. Значимость говорит, что наклон, скорее всего, не нулевой; \(R^2\) и сам наклон говорят, велика ли связь.

Вторая: низкий \(R^2\) не значит, что возраст не важен. Медианная аренда в домах моложе 30 лет 175–300 тыс. ₽, в домах 40–60 лет (массовая застройка 1960–1980-х) около 45–50 тыс., а в домах старше 90 лет, в основном в центре, снова 250 тыс. Зависимость похожа на яму, и прямая её не видит. Отчасти это та же площадь: в домах 1960–1980-х квартиры маленькие, медиана 45–50 м². \(R^2\) измеряет, насколько хорошо работает именно прямая.

Остаток −28 тыс. ₽ не значит, что квартира «недооценена». Он значит, что она дешевле типичной квартиры той же площади. Причина может быть в том, чего в линии нет: район, ремонт, этаж. Пересечение −1,12 тоже не стоит толковать буквально: квартир площадью 0 м² не бывает, а за пределами данных линия может вести себя как угодно.

Главное

Корреляция показывает тесноту линейной связи, наклон регрессии — на сколько в среднем различается \(y\) при различии \(x\) на единицу, \(R^2\) — какую долю разброса объясняет линия. Значимый наклон может быть ничтожным, а связь — не причиной.

Проверьте себя

По регрессии \(\widehat{\text{аренда}} = -1{,}12 + 1{,}99 \cdot \text{площадь}\) (тыс. ₽, м²) какой аренды ждать за квартиру 60 м²? Округлите до десятых.

тыс. ₽

Квартира 100 м² сдаётся за 170 тыс. ₽. Каков её остаток относительно линии \(\widehat{\text{аренда}} = -1{,}12 + 1{,}99 \cdot \text{площадь}\)? Округлите до десятых.

тыс. ₽

Корреляция между рекламным бюджетом магазинов сети и их выручкой равна 0,5. Какую долю различий в выручке объясняет линия регрессии выручки на бюджет? Ответ дайте долей.

Корреляция между температурой воздуха и продажами горячего шоколада в кафе за год близка к нулю. Какой вывод правильный?

Варианты ответа

Этаж, площадь и пропущенная переменная

Владелец квартиры на последнем этаже решает, нужна ли скидка: принято считать, что первые и последние этажи сдаются хуже. Данные ЦИАН как будто говорят обратное: 172 квартиры на первом или последнем этаже сдаются в среднем за 265,8 тыс. ₽, а 1293 квартиры на средних этажах за 239,4 тыс. Разница 26 тыс. ₽ в пользу крайних этажей, хотя статистически она незначима (p ≈ 0,12).

Вопрос

Какое объяснение стоит проверить первым?

Варианты ответа

Сравнивать при прочих равных

Множественная регрессия

Идея. В регрессию можно включить несколько объясняющих переменных. Коэффициент при каждой показывает, на сколько в среднем различается \(y\) при различии этой переменной на единицу и неизменных остальных (при прочих равных, ceteris paribus).

Фиктивная переменная (dummy variable) кодирует категорию нулём и единицей: «крайний этаж» равен 1 для первого и последнего этажа и 0 для остальных. Её коэффициент — разница между категориями при одинаковых остальных переменных.

Пример.

\[\widehat{\text{аренда}} = 0{,}2 + 2{,}00 \cdot \text{площадь} - 25{,}5 \cdot \text{крайний этаж}.\]

При одинаковой площади квартира на крайнем этаже сдаётся в среднем на 25,5 тыс. ₽ дешевле (p ≈ 0,007). Знак поменялся по сравнению с разницей средних.

Проверьте себя. Какой прогноз для квартиры 100 м² на последнем этаже? (\(0{,}2 + 200 - 25{,}5 \approx 174{,}7\) тыс. ₽.)

Ошибку простого сравнения называют смещением из-за пропущенной переменной (omitted variable bias). Оно возникает, когда не учтённая переменная (площадь) влияет на результат (аренду) и связана с изучаемой (этажом).

Симуляция

Пройдите три шага: сравните средние по группам, посмотрите на площадь, затем сравните аренду при одинаковой площади. Ответьте: на сколько дешевле квартира на крайнем этаже той же площади?

Регрессия с несколькими признаками

Обычно в регрессию включают всё, что есть в данных. Вот регрессия аренды на возраст, площадь, балкон и тип дома по всем 1465 объявлениям (\(R^2 = 0{,}63\)):

Переменная Коэффициент p-значение
Пересечение −47,1 0,002
Возраст дома, лет −0,06 0,63
Площадь, м² 1,92 < 0,001
Балкон 15,2 0,014
Балкон и лоджия 5,0 0,67
Монолит 71,0 < 0,001
Кирпич 26,6 0,097
Панель −5,3 0,76

Как это читать.

  • Базовая категория. У типа дома четыре значения, а фиктивных переменных три. Четвёртое, «другой тип» (66 объявлений), — база сравнения. Коэффициент 71,0 означает: квартира в монолитном доме сдаётся в среднем на 71 тыс. ₽ дороже, чем такая же по площади, возрасту и балкону квартира в доме «другого» типа. Не дороже кирпичной: разница монолита с кирпичом \(71{,}0 - 26{,}6 = 44{,}4\).
  • Значимость. Звёздочки и p-значения в таблицах регрессий отвечают на вопрос, можно ли отличить коэффициент от нуля. Они не обещают, что оценка не изменится на других данных: у каждого коэффициента есть свой доверительный интервал.
  • Прогноз. Квартира 80 м² в 25-летнем панельном доме без балкона: \(-47{,}1 - 0{,}06 \cdot 25 + 1{,}92 \cdot 80 - 5{,}3 \approx 99{,}7\) тыс. ₽.

Если добавить в эту регрессию крайний этаж, его коэффициент станет около −15 тыс. ₽ (p ≈ 0,11). Знак остаётся отрицательным, но оценка зависит от того, что ещё учтено, и честный отчёт показывает несколько вариантов. А главного для аренды признака, района, в данных нет вообще. Пропущенная переменная может исказить любой коэффициент, поэтому регрессия по наблюдениям показывает связь при учтённых условиях, но не доказывает причину. Надёжнее всего причину устанавливает случайный эксперимент из раздела 3.

Размер класса и оценки, Калифорния

В широко известном исследовании по 420 школьным округам Калифорнии (1998–1999 учебный год) регрессия средней оценки за тест на число учеников на учителя дала коэффициент −2,28: на одного ученика в классе больше, на 2,28 балла ниже результат. Когда добавили долю учеников, для которых английский не родной, коэффициент упал до −1,10, а \(R^2\) вырос с 0,05 до 0,43. Большие классы чаще встречались в округах, где много детей из семей иммигрантов, и часть «эффекта размера класса» на деле отражала состав учеников.

Та же ловушка ждёт при оценке спроса. В истории продаж цены и объёмы часто растут вместе: в удачные годы спрос высок, и компания поднимает цену. Регрессия продаж на одну цену покажет «восходящий спрос». Как с этим справляются, увидите в теме 6.

Главное

Коэффициент множественной регрессии — различие при прочих равных, коэффициент фиктивной переменной — отличие от базовой категории. Пропущенная переменная, связанная и с результатом, и с изучаемым признаком, может изменить вывод вплоть до знака.

Проверьте себя

По регрессии из таблицы раздела (−47,1 − 0,06 · возраст + 1,92 · площадь + 15,2 · балкон + 5,0 · балкон и лоджия + 71,0 · монолит + 26,6 · кирпич − 5,3 · панель) спрогнозируйте аренду квартиры 60 м² в 10-летнем монолитном доме с балконом. Округлите до десятых.

тыс. ₽

В той же регрессии коэффициент при «кирпич» равен 26,6, а базовая категория типа дома «другой». Что он означает?

Варианты ответа

Регрессия продаж менеджеров на число часов обучения дала коэффициент +5 тыс. ₽ за час. Обучение добровольное. Какая пропущенная переменная вероятнее всего завышает эту оценку?

Варианты ответа

В регрессии аренды на возраст дома наклон −0,28 тыс. ₽ за год значим (p = 0,039), но \(R^2 = 0{,}003\). Как это понимать?

Варианты ответа