Перейти к содержанию
Данные и AI

11 вопросов по теме «аналитика данных: Статистика» на собеседовании

В этом материале — 11 вопросов из русской колоды RecallDeck по теме «аналитика данных: Статистика». Сначала сформулируйте короткий ответ сами, затем откройте подробный разбор и проверьте примеры, ограничения и отказные случаи.

9 мин чтения11 подробных ответовПроверено 24 августа 2026
Главная мысль

Сначала зафиксируйте grain данных, допущения, метрику и риск leakage, затем обсуждайте модель, инструмент или инфраструктуру.

Вопросы и ответы

11 подробных ответов

01

Чем отличаются среднее, медиана и мода, и почему для скошенных данных (доход, время отклика) лучше брать медиану?

Короткий ответ: Среднее — сумма, делённая на количество, чувствительно к выбросам. Медиана — центральное значение упорядоченного ряда, устойчива к выбросам. Мода — самое частое значение. Для скошенных данных медиана точнее отражает «типичное» наблюдение.

Подробно:

  1. Среднее (mean) — хорошо для симметричных данных и для дальнейших расчётов (дисперсия, регрессия), но один выброс сдвигает его.
  2. Медиана — 50-й перцентиль; делит данные пополам и почти не реагирует на экстремумы.
  3. Мода — единственная метрика для категориальных данных («самый частый тариф»).
Метрика Когда применять Чувствительность к выбросам
Среднее симметричные данные, дальнейшие расчёты высокая
Медиана скошенные данные: доход, время отклика, цены низкая
Мода категориальные данные, самое частое значение низкая

⚠️ Частая ошибка: отчитываться средним по доходу или времени отклика. Длинный правый хвост тянет среднее вверх, и оно перестаёт описывать типичного пользователя — берите медиану.

02

Что измеряют дисперсия и стандартное отклонение, и почему при сравнении групп важно смотреть не только на среднее?

Короткий ответ: Дисперсия — средний квадрат отклонений от среднего; стандартное отклонение — её корень, в тех же единицах, что и данные. Две группы с одинаковым средним могут сильно различаться по разбросу, поэтому одного среднего недостаточно.

Подробно:

  1. Дисперсия (σ²) — насколько значения «разбросаны» вокруг среднего; в квадрате единиц.
  2. Стандартное отклонение (σ) — корень из дисперсии, в исходных единицах, поэтому интерпретируется легче.
  3. Выборочная оценка — деление на n−1 (поправка Бесселя, ddof=1) даёт несмещённую оценку дисперсии генеральной совокупности.
  4. Зачем при сравнении групп — одинаковое среднее может скрывать разную стабильность (риск, надёжность).
import numpy as np
a = [50, 50, 50, 50]      # среднее 50, разброса нет
b = [10, 30, 70, 90]      # среднее 50, большой разброс
np.mean(a), np.mean(b)               # (50.0, 50.0)
np.std(a, ddof=1), np.std(b, ddof=1) # (0.0, 36.5)  ← ddof=1: деление на n-1

⚠️ Частая ошибка: сравнивать группы только по среднему. Одинаковое среднее при разном стандартном отклонении — это совершенно разное поведение метрики.

03

Что такое нормальное распределение и правило 68–95–99.7? Как скошенность и тяжёлые хвосты влияют на сводные статистики?

Короткий ответ: Нормальное (гауссово) распределение симметрично и колоколообразно. Примерно 68% значений лежат в пределах ±1σ от среднего, ~95% — в ±2σ, ~99.7% — в ±3σ. При скошенности среднее уходит в сторону длинного хвоста, и медиана становится надёжнее.

Подробно:

  1. Симметрия — у идеальной нормали среднее = медиана = мода.
  2. Правило 68-95-99.7 — задаёт, какая доля данных попадает в окрестности среднего, и лежит в основе z-оценок.
  3. Скошенность (skew) — правый хвост (доход, выручка) тянет среднее вправо: mean > median.
  4. Тяжёлые хвосты (kurtosis) — экстремальных значений больше, чем предсказывает нормаль; правило 3σ недооценивает риск.
            .-^^^-.
          .'   |   '.        нормальная кривая
         /     |     \
        |  68% ◀-+-▶  |
      95% ◀-----+-----▶
  99.7% ◀-------+-------▶
   -3σ  -2σ  -1σ  μ  +1σ  +2σ  +3σ

⚠️ Частая ошибка: считать все данные нормальными. Доход, время отклика и выручка обычно скошены — проверяйте распределение (гистограмма, Q-Q plot) до применения правил для нормали.

04

Сформулируйте центральную предельную теорему и объясните, почему она позволяет делать выводы по выборочным средним. Чем стандартное отклонение отличается от стандартной ошибки?

Короткий ответ: ЦПТ: распределение выборочного среднего стремится к нормальному с ростом размера выборки n, независимо от формы исходного распределения (при конечной дисперсии). Поэтому можно строить доверительные интервалы и проверять гипотезы о среднем. Стандартное отклонение (σ) описывает разброс отдельных наблюдений, а стандартная ошибка (SE = σ/√n) — разброс выборочного среднего.

Подробно:

  1. Что утверждает ЦПТ — даже для скошенных данных распределение среднего по многим выборкам ≈ нормальное.
  2. Условия — независимые наблюдения, конечная дисперсия, достаточный n (часто n ≥ 30 как эмпирическое правило).
  3. σ vs SE — σ не зависит от n; SE падает с ростом выборки.
  4. Следствие — точность оценки среднего растёт как √n: чтобы вдвое сузить интервал, нужно вчетверо больше данных.
σ   = разброс отдельных наблюдений (не зависит от n)
SE  = σ / √n   ← разброс среднего, падает с ростом выборки
n=100 → SE = σ/10;  уменьшить SE вдвое → нужно ×4 наблюдений

⚠️ Частая ошибка: думать, что ЦПТ делает нормальными сами данные. Нормальным становится распределение выборочного среднего, а не исходная переменная.

05

Как устроена проверка гипотез: нулевая и альтернативная гипотезы, уровень значимости α, и что на самом деле означает p-значение (а что — нет)?

Короткий ответ: Нулевая гипотеза (H₀) — «эффекта нет»; альтернативная (H₁) — «эффект есть». p-значение — вероятность получить данные настолько же или более экстремальные, чем наблюдаемые, ПРИ условии, что H₀ верна. Если p < α (обычно 0.05), H₀ отвергают.

Подробно:

  1. H₀ и H₁ — формулируются до сбора данных; тест ищет основания отвергнуть H₀.
  2. Уровень значимости α — заранее выбранный порог и допустимая вероятность ошибки I рода.
  3. p-значение — P(данные настолько экстремальные | H₀ верна), не более.
  4. Решение — p < α → отвергаем H₀; иначе «недостаточно доказательств» (но не «H₀ доказана»).
      распределение статистики при H₀
           .-^^^-.
         .'       '.
        /           \▓▓▓  ← p-value = площадь хвоста
   ----+-------------+-▲--   ▲ = наблюдаемое значение
                  p < α  →  отвергаем H₀

⚠️ Частая ошибка: p-значение — это НЕ вероятность того, что H₀ верна, и НЕ вероятность «случайности» результата. Это P(данные | H₀), а не P(H₀ | данные).

06

В чём разница между ошибками I и II рода, что такое статистическая мощность и как они связаны?

Короткий ответ: Ошибка I рода (α) — отвергнуть верную H₀ (ложноположительный результат). Ошибка II рода (β) — не отвергнуть ложную H₀ (ложноотрицательный). Мощность = 1 − β — вероятность обнаружить реально существующий эффект. При фиксированной выборке снижение α повышает β.

Подробно:

  1. Ошибка I рода (α) — «увидели эффект, которого нет»; контролируется выбором α.
  2. Ошибка II рода (β) — «пропустили реальный эффект».
  3. Мощность (1 − β) — растёт с размером эффекта, размером выборки и α.
  4. Компромисс — при том же n уменьшение α увеличивает β; обе ошибки снижают увеличением выборки.
H₀ верна H₀ ложна
Отвергли H₀ Ошибка I рода (α) Верно — мощность (1−β)
Не отвергли H₀ Верно (1−α) Ошибка II рода (β)

⚠️ Частая ошибка: бороться только с ложноположительными, снижая α, и забывать, что это раздувает β. Чтобы уменьшить обе ошибки одновременно, увеличивают размер выборки.

07

Как правильно интерпретировать 95% доверительный интервал и почему он информативнее точечной оценки?

Короткий ответ: 95% доверительный интервал — это интервал, построенный процедурой, которая при многократном повторении выборок накрывает истинное значение параметра в 95% случаев. Он показывает не только оценку, но и её неопределённость (ширину), чего точечная оценка не даёт.

Подробно:

  1. Правильная интерпретация — утверждение про процедуру / долгосрочную частоту, а не про конкретный посчитанный интервал.
  2. Ширина — узкий ДИ = высокая точность; зависит от стандартной ошибки и размера выборки n.
  3. Связь с тестом — если 95% ДИ для разности не содержит 0, эффект значим на уровне α = 0.05.
from scipy import stats
import numpy as np
data = np.array([4.1, 5.2, 3.8, 6.0, 4.7, 5.5])
# 95% ДИ для среднего (t-распределение, малая выборка)
stats.t.interval(0.95, df=len(data)-1,
                 loc=data.mean(),
                 scale=stats.sem(data))   # (4.00, 5.77)

⚠️ Частая ошибка: говорить «с вероятностью 95% истинное значение лежит в этом интервале». Параметр фиксирован, случайна процедура; 95% — доля интервалов, накрывающих истину при многократном повторении.

08

В чём разница между корреляцией и причинностью? Что показывает коэффициент r и при чём здесь конфаундеры и парадокс Симпсона?

Короткий ответ: Корреляция измеряет силу и направление линейной связи (коэффициент r от −1 до +1), но не доказывает причинность. Наблюдаемую связь могут объяснять скрытый конфаундер, обратная причинность или случайность.

Подробно:

  1. Коэффициент r — близко к ±1 = сильная линейная связь; r = 0 значит нет ЛИНЕЙНОЙ связи (нелинейная может быть).
  2. Почему ≠ причинность — конфаундер (общая причина), обратная причинность, совпадение.
  3. Парадокс Симпсона — направление связи в агрегате может разворачиваться на противоположное внутри подгрупп.
  4. Как приблизиться к причинности — рандомизированный эксперимент (A/B-тест) или контроль конфаундеров.
r Интерпретация
+1 идеальная прямая линейная связь
0 нет линейной связи (возможна нелинейная)
−1 идеальная обратная линейная связь

⚠️ Частая ошибка: делать вывод о причине из наблюдательной корреляции. Продажи мороженого и число утоплений коррелируют, но причина — жара (конфаундер), а не мороженое.

09

Как аналитику интерпретировать коэффициенты и R² в линейной регрессии, и какие основные допущения и подводные камни нужно помнить?

Короткий ответ: Коэффициент при предикторе показывает, на сколько в среднем меняется отклик при росте этого предиктора на 1 единицу при прочих равных. R² — доля дисперсии отклика, объяснённая моделью (от 0 до 1). Линейная регрессия требует линейности, независимости остатков и постоянства их дисперсии.

Подробно:

  1. Коэффициенты (β) — наклон; знак задаёт направление, величина — размер эффекта «при прочих равных».
  2. — доля объяснённой дисперсии; высокий R² ≠ хорошая или причинная модель.
  3. Допущения — линейность, независимость остатков, гомоскедастичность, приближённая нормальность остатков.
  4. Подводные камни — мультиколлинеарность (нестабильные коэффициенты), экстраполяция за пределы данных, выбросы.
Понятие Что значит Ловушка
β (коэффициент) изменение y на +1 ед. x, при прочих равных путать с причинностью
доля объяснённой дисперсии растёт при добавлении любых предикторов
Мультиколлинеарность предикторы коррелируют между собой нестабильные, неинтерпретируемые β

⚠️ Частая ошибка: гнаться за высоким R², добавляя предикторы. Смотрите на скорректированный R² (adjusted R²) и анализируйте остатки — высокий R² не гарантирует ни валидности, ни причинности.

10

Как выбрать статистический тест: t-критерий, z-критерий или хи-квадрат — что каждый сравнивает и когда применять?

Короткий ответ: t-критерий сравнивает средние при малой выборке и неизвестной σ; z-критерий сравнивает средние или доли при большой выборке и известной σ; хи-квадрат проверяет связь между категориальными переменными по частотам.

Подробно:

  1. t-критерий — одновыборочный, двухвыборочный или парный; для числовых данных, когда σ генеральной совокупности неизвестна.
  2. z-критерий — на практике редок для средних (σ обычно неизвестна), но это база для тестов долей и больших выборок.
  3. Хи-квадрат — критерий согласия и независимости; работает с таблицами сопряжённости.
Тест Что сравнивает Когда применять
t-критерий средние 1–2 групп числовые данные, малая выборка (n<30), σ неизвестна
z-критерий средние или доли большая выборка (n≥30), σ известна
Хи-квадрат частоты категорий категориальные данные, таблицы сопряжённости

⚠️ Частая ошибка: применять t- или z-критерий к категориальным частотам, а хи-квадрат — к средним. Сначала определите тип данных (числовые vs категориальные) и число групп.

11

Какие бывают методы выборки (случайная, стратифицированная) и какие систематические смещения (selection, survivorship, response) портят анализ?

Короткий ответ: Хорошая выборка репрезентативна для генеральной совокупности. Случайная даёт каждому равный шанс попасть в выборку; стратифицированная делит популяцию на подгруппы и берёт из каждой. Смещения возникают, когда выборка систематически отличается от популяции.

Подробно:

  1. Случайная (random) — равный шанс для всех; базовый эталон репрезентативности.
  2. Стратифицированная (stratified) — отбор пропорционально подгруппам; точнее при неоднородной популяции.
  3. Кластерная (cluster) — выбираем целые группы (магазины, города); дешевле, но грубее.
Смещение В чём суть Пример
Selection bias выборка нерепрезентативна опрос только активных пользователей
Survivorship bias видим только «выживших» анализ только прибыльных компаний
Response bias отвечают не все / отвечают неискренне отзывы оставляют крайне довольные и злые

⚠️ Частая ошибка: считать большую выборку автоматически хорошей. Смещённая выборка из миллиона хуже маленькой случайной — размер не лечит систематическую ошибку (провал опроса Literary Digest в 1936 году).

Источники

Источники и редакционная политика

Материалы RecallDeck сопоставлены с официальной документацией и открытыми публикациями компаний, когда первичный источник доступен. Мы не связаны с упомянутыми работодателями, не публикуем конфиденциальные задания и не продаём места в подборках. Формат найма может меняться — уточняйте его у рекрутера.

От чтения к воспроизведению

Отрепетируйте полный цикл интервью.

RecallDeck возвращает сложные темы по расписанию и помогает удерживать в памяти язык, SQL, архитектуру и поведенческие истории.

Начать подготовку

Продолжить подготовку

Библиотека собеседований RecallDeck

Подробные русские ответы, разборы этапов найма и планы подготовки для российского IT-рынка.

RSS