Сначала зафиксируйте grain данных, допущения, метрику и риск leakage, затем обсуждайте модель, инструмент или инфраструктуру.
Вопросы и ответы
11 подробных ответов
01Чем отличаются среднее, медиана и мода, и почему для скошенных данных (доход, время отклика) лучше брать медиану?
junior
Короткий ответ: Среднее — сумма, делённая на количество, чувствительно к выбросам. Медиана — центральное значение упорядоченного ряда, устойчива к выбросам. Мода — самое частое значение. Для скошенных данных медиана точнее отражает «типичное» наблюдение.
Подробно:
- Среднее (mean) — хорошо для симметричных данных и для дальнейших расчётов (дисперсия, регрессия), но один выброс сдвигает его.
- Медиана — 50-й перцентиль; делит данные пополам и почти не реагирует на экстремумы.
- Мода — единственная метрика для категориальных данных («самый частый тариф»).
| Метрика | Когда применять | Чувствительность к выбросам |
|---|---|---|
| Среднее | симметричные данные, дальнейшие расчёты | высокая |
| Медиана | скошенные данные: доход, время отклика, цены | низкая |
| Мода | категориальные данные, самое частое значение | низкая |
⚠️ Частая ошибка: отчитываться средним по доходу или времени отклика. Длинный правый хвост тянет среднее вверх, и оно перестаёт описывать типичного пользователя — берите медиану.
02Что измеряют дисперсия и стандартное отклонение, и почему при сравнении групп важно смотреть не только на среднее?
middle
Короткий ответ: Дисперсия — средний квадрат отклонений от среднего; стандартное отклонение — её корень, в тех же единицах, что и данные. Две группы с одинаковым средним могут сильно различаться по разбросу, поэтому одного среднего недостаточно.
Подробно:
- Дисперсия (σ²) — насколько значения «разбросаны» вокруг среднего; в квадрате единиц.
- Стандартное отклонение (σ) — корень из дисперсии, в исходных единицах, поэтому интерпретируется легче.
- Выборочная оценка — деление на n−1 (поправка Бесселя,
ddof=1) даёт несмещённую оценку дисперсии генеральной совокупности. - Зачем при сравнении групп — одинаковое среднее может скрывать разную стабильность (риск, надёжность).
import numpy as np
a = [50, 50, 50, 50] # среднее 50, разброса нет
b = [10, 30, 70, 90] # среднее 50, большой разброс
np.mean(a), np.mean(b) # (50.0, 50.0)
np.std(a, ddof=1), np.std(b, ddof=1) # (0.0, 36.5) ← ddof=1: деление на n-1
⚠️ Частая ошибка: сравнивать группы только по среднему. Одинаковое среднее при разном стандартном отклонении — это совершенно разное поведение метрики.
03Что такое нормальное распределение и правило 68–95–99.7? Как скошенность и тяжёлые хвосты влияют на сводные статистики?
middle
Короткий ответ: Нормальное (гауссово) распределение симметрично и колоколообразно. Примерно 68% значений лежат в пределах ±1σ от среднего, ~95% — в ±2σ, ~99.7% — в ±3σ. При скошенности среднее уходит в сторону длинного хвоста, и медиана становится надёжнее.
Подробно:
- Симметрия — у идеальной нормали среднее = медиана = мода.
- Правило 68-95-99.7 — задаёт, какая доля данных попадает в окрестности среднего, и лежит в основе z-оценок.
- Скошенность (skew) — правый хвост (доход, выручка) тянет среднее вправо: mean > median.
- Тяжёлые хвосты (kurtosis) — экстремальных значений больше, чем предсказывает нормаль; правило 3σ недооценивает риск.
.-^^^-.
.' | '. нормальная кривая
/ | \
| 68% ◀-+-▶ |
95% ◀-----+-----▶
99.7% ◀-------+-------▶
-3σ -2σ -1σ μ +1σ +2σ +3σ
⚠️ Частая ошибка: считать все данные нормальными. Доход, время отклика и выручка обычно скошены — проверяйте распределение (гистограмма, Q-Q plot) до применения правил для нормали.
04Сформулируйте центральную предельную теорему и объясните, почему она позволяет делать выводы по выборочным средним. Чем стандартное отклонение отличается от стандартной ошибки?
senior
Короткий ответ: ЦПТ: распределение выборочного среднего стремится к нормальному с ростом размера выборки n, независимо от формы исходного распределения (при конечной дисперсии). Поэтому можно строить доверительные интервалы и проверять гипотезы о среднем. Стандартное отклонение (σ) описывает разброс отдельных наблюдений, а стандартная ошибка (SE = σ/√n) — разброс выборочного среднего.
Подробно:
- Что утверждает ЦПТ — даже для скошенных данных распределение среднего по многим выборкам ≈ нормальное.
- Условия — независимые наблюдения, конечная дисперсия, достаточный n (часто n ≥ 30 как эмпирическое правило).
- σ vs SE — σ не зависит от n; SE падает с ростом выборки.
- Следствие — точность оценки среднего растёт как √n: чтобы вдвое сузить интервал, нужно вчетверо больше данных.
σ = разброс отдельных наблюдений (не зависит от n)
SE = σ / √n ← разброс среднего, падает с ростом выборки
n=100 → SE = σ/10; уменьшить SE вдвое → нужно ×4 наблюдений
⚠️ Частая ошибка: думать, что ЦПТ делает нормальными сами данные. Нормальным становится распределение выборочного среднего, а не исходная переменная.
05Как устроена проверка гипотез: нулевая и альтернативная гипотезы, уровень значимости α, и что на самом деле означает p-значение (а что — нет)?
senior
Короткий ответ: Нулевая гипотеза (H₀) — «эффекта нет»; альтернативная (H₁) — «эффект есть». p-значение — вероятность получить данные настолько же или более экстремальные, чем наблюдаемые, ПРИ условии, что H₀ верна. Если p < α (обычно 0.05), H₀ отвергают.
Подробно:
- H₀ и H₁ — формулируются до сбора данных; тест ищет основания отвергнуть H₀.
- Уровень значимости α — заранее выбранный порог и допустимая вероятность ошибки I рода.
- p-значение — P(данные настолько экстремальные | H₀ верна), не более.
- Решение — p < α → отвергаем H₀; иначе «недостаточно доказательств» (но не «H₀ доказана»).
распределение статистики при H₀
.-^^^-.
.' '.
/ \▓▓▓ ← p-value = площадь хвоста
----+-------------+-▲-- ▲ = наблюдаемое значение
p < α → отвергаем H₀
⚠️ Частая ошибка: p-значение — это НЕ вероятность того, что H₀ верна, и НЕ вероятность «случайности» результата. Это P(данные | H₀), а не P(H₀ | данные).
06В чём разница между ошибками I и II рода, что такое статистическая мощность и как они связаны?
senior
Короткий ответ: Ошибка I рода (α) — отвергнуть верную H₀ (ложноположительный результат). Ошибка II рода (β) — не отвергнуть ложную H₀ (ложноотрицательный). Мощность = 1 − β — вероятность обнаружить реально существующий эффект. При фиксированной выборке снижение α повышает β.
Подробно:
- Ошибка I рода (α) — «увидели эффект, которого нет»; контролируется выбором α.
- Ошибка II рода (β) — «пропустили реальный эффект».
- Мощность (1 − β) — растёт с размером эффекта, размером выборки и α.
- Компромисс — при том же n уменьшение α увеличивает β; обе ошибки снижают увеличением выборки.
| H₀ верна | H₀ ложна | |
|---|---|---|
| Отвергли H₀ | Ошибка I рода (α) | Верно — мощность (1−β) |
| Не отвергли H₀ | Верно (1−α) | Ошибка II рода (β) |
⚠️ Частая ошибка: бороться только с ложноположительными, снижая α, и забывать, что это раздувает β. Чтобы уменьшить обе ошибки одновременно, увеличивают размер выборки.
07Как правильно интерпретировать 95% доверительный интервал и почему он информативнее точечной оценки?
middle
Короткий ответ: 95% доверительный интервал — это интервал, построенный процедурой, которая при многократном повторении выборок накрывает истинное значение параметра в 95% случаев. Он показывает не только оценку, но и её неопределённость (ширину), чего точечная оценка не даёт.
Подробно:
- Правильная интерпретация — утверждение про процедуру / долгосрочную частоту, а не про конкретный посчитанный интервал.
- Ширина — узкий ДИ = высокая точность; зависит от стандартной ошибки и размера выборки n.
- Связь с тестом — если 95% ДИ для разности не содержит 0, эффект значим на уровне α = 0.05.
from scipy import stats
import numpy as np
data = np.array([4.1, 5.2, 3.8, 6.0, 4.7, 5.5])
# 95% ДИ для среднего (t-распределение, малая выборка)
stats.t.interval(0.95, df=len(data)-1,
loc=data.mean(),
scale=stats.sem(data)) # (4.00, 5.77)
⚠️ Частая ошибка: говорить «с вероятностью 95% истинное значение лежит в этом интервале». Параметр фиксирован, случайна процедура; 95% — доля интервалов, накрывающих истину при многократном повторении.
08В чём разница между корреляцией и причинностью? Что показывает коэффициент r и при чём здесь конфаундеры и парадокс Симпсона?
middle
Короткий ответ: Корреляция измеряет силу и направление линейной связи (коэффициент r от −1 до +1), но не доказывает причинность. Наблюдаемую связь могут объяснять скрытый конфаундер, обратная причинность или случайность.
Подробно:
- Коэффициент r — близко к ±1 = сильная линейная связь; r = 0 значит нет ЛИНЕЙНОЙ связи (нелинейная может быть).
- Почему ≠ причинность — конфаундер (общая причина), обратная причинность, совпадение.
- Парадокс Симпсона — направление связи в агрегате может разворачиваться на противоположное внутри подгрупп.
- Как приблизиться к причинности — рандомизированный эксперимент (A/B-тест) или контроль конфаундеров.
| r | Интерпретация |
|---|---|
| +1 | идеальная прямая линейная связь |
| 0 | нет линейной связи (возможна нелинейная) |
| −1 | идеальная обратная линейная связь |
⚠️ Частая ошибка: делать вывод о причине из наблюдательной корреляции. Продажи мороженого и число утоплений коррелируют, но причина — жара (конфаундер), а не мороженое.
09Как аналитику интерпретировать коэффициенты и R² в линейной регрессии, и какие основные допущения и подводные камни нужно помнить?
senior
Короткий ответ: Коэффициент при предикторе показывает, на сколько в среднем меняется отклик при росте этого предиктора на 1 единицу при прочих равных. R² — доля дисперсии отклика, объяснённая моделью (от 0 до 1). Линейная регрессия требует линейности, независимости остатков и постоянства их дисперсии.
Подробно:
- Коэффициенты (β) — наклон; знак задаёт направление, величина — размер эффекта «при прочих равных».
- R² — доля объяснённой дисперсии; высокий R² ≠ хорошая или причинная модель.
- Допущения — линейность, независимость остатков, гомоскедастичность, приближённая нормальность остатков.
- Подводные камни — мультиколлинеарность (нестабильные коэффициенты), экстраполяция за пределы данных, выбросы.
| Понятие | Что значит | Ловушка |
|---|---|---|
| β (коэффициент) | изменение y на +1 ед. x, при прочих равных | путать с причинностью |
| R² | доля объяснённой дисперсии | растёт при добавлении любых предикторов |
| Мультиколлинеарность | предикторы коррелируют между собой | нестабильные, неинтерпретируемые β |
⚠️ Частая ошибка: гнаться за высоким R², добавляя предикторы. Смотрите на скорректированный R² (adjusted R²) и анализируйте остатки — высокий R² не гарантирует ни валидности, ни причинности.
10Как выбрать статистический тест: t-критерий, z-критерий или хи-квадрат — что каждый сравнивает и когда применять?
middle
Короткий ответ: t-критерий сравнивает средние при малой выборке и неизвестной σ; z-критерий сравнивает средние или доли при большой выборке и известной σ; хи-квадрат проверяет связь между категориальными переменными по частотам.
Подробно:
- t-критерий — одновыборочный, двухвыборочный или парный; для числовых данных, когда σ генеральной совокупности неизвестна.
- z-критерий — на практике редок для средних (σ обычно неизвестна), но это база для тестов долей и больших выборок.
- Хи-квадрат — критерий согласия и независимости; работает с таблицами сопряжённости.
| Тест | Что сравнивает | Когда применять |
|---|---|---|
| t-критерий | средние 1–2 групп | числовые данные, малая выборка (n<30), σ неизвестна |
| z-критерий | средние или доли | большая выборка (n≥30), σ известна |
| Хи-квадрат | частоты категорий | категориальные данные, таблицы сопряжённости |
⚠️ Частая ошибка: применять t- или z-критерий к категориальным частотам, а хи-квадрат — к средним. Сначала определите тип данных (числовые vs категориальные) и число групп.
11Какие бывают методы выборки (случайная, стратифицированная) и какие систематические смещения (selection, survivorship, response) портят анализ?
middle
Короткий ответ: Хорошая выборка репрезентативна для генеральной совокупности. Случайная даёт каждому равный шанс попасть в выборку; стратифицированная делит популяцию на подгруппы и берёт из каждой. Смещения возникают, когда выборка систематически отличается от популяции.
Подробно:
- Случайная (random) — равный шанс для всех; базовый эталон репрезентативности.
- Стратифицированная (stratified) — отбор пропорционально подгруппам; точнее при неоднородной популяции.
- Кластерная (cluster) — выбираем целые группы (магазины, города); дешевле, но грубее.
| Смещение | В чём суть | Пример |
|---|---|---|
| Selection bias | выборка нерепрезентативна | опрос только активных пользователей |
| Survivorship bias | видим только «выживших» | анализ только прибыльных компаний |
| Response bias | отвечают не все / отвечают неискренне | отзывы оставляют крайне довольные и злые |
⚠️ Частая ошибка: считать большую выборку автоматически хорошей. Смещённая выборка из миллиона хуже маленькой случайной — размер не лечит систематическую ошибку (провал опроса Literary Digest в 1936 году).
Источники
Источники и редакционная политика
Материалы RecallDeck сопоставлены с официальной документацией и открытыми публикациями компаний, когда первичный источник доступен. Мы не связаны с упомянутыми работодателями, не публикуем конфиденциальные задания и не продаём места в подборках. Формат найма может меняться — уточняйте его у рекрутера.
От чтения к воспроизведению
Отрепетируйте полный цикл интервью.
RecallDeck возвращает сложные темы по расписанию и помогает удерживать в памяти язык, SQL, архитектуру и поведенческие истории.