Подготовка к собеседованию — Аналитик данных
Колода из 265+ карточек с вопросами для собеседования по направлению «Аналитик данных» — по темам и уровню сложности, с повторениями по вашим оценкам. Посмотрите несколько карточек ниже, затем выберите доступ, чтобы учить всё направление по расписанию в стиле Anki (SM-2).
Новым подписчикам месяца или года может быть доступно 7 дней бесплатно. Условия и сумму подтвердит страница оплаты.
С чего начать
Начните с основ SQL, арифметики и статистики. Для модулей Python и pandas нужно читать простой Python-код; параллельно практикуйте запросы и анализ на небольшом наборе данных.
Первый проход: Базы данных → SQL для аналитики. Начните с базовых вопросов в этих модулях, затем продолжайте по плану. К сложным и senior-вопросам возвращайтесь по требованиям вакансии; все карточки доступны с самого начала.
Общие темы могут входить в несколько направлений и сохраняют одну историю повторений. План ниже отмечает общие основы и профильные модули; выбирайте глубину под свою вакансию.
Что внутри
Все темы направления, сгруппированные так, как вы будете их учить.
Базы данных
42 карточкиОбщие основы
SQL для аналитики
11 карточекПрофильный модуль
Статистика и вероятность
11 карточекПрофильный модуль
A/B-тесты и эксперименты
9 карточекПрофильный модуль
Продуктовые и бизнес-метрики
10 карточекПрофильный модуль
Визуализация данных и сторителлинг
8 карточекПрофильный модуль
Python
122 карточкиОбщие основы
Python для аналитиков (pandas и matplotlib)
10 карточекПрофильный модуль
Аналитические кейсы
7 карточекПрофильный модуль
Поведенческое интервью
35 карточекОбщие основы
Примеры вопросов
Несколько карточек из колоды — откройте ответ, затем выберите доступ, чтобы учить весь набор по расписанию.
Что делает SELECT и в каком порядке выполняются части запроса?
Что делает SELECT и в каком порядке выполняются части запроса?
Короткий ответ: SELECT извлекает строки из таблиц. Логический порядок выполнения НЕ совпадает с порядком написания: сначала FROM, затем WHERE, GROUP BY, HAVING, SELECT, DISTINCT, ORDER BY, LIMIT.
Подробно:
Порядок написания (синтаксический):
SELECT DISTINCT col1, agg(col2)
FROM t
WHERE cond
GROUP BY col1
HAVING agg_cond
ORDER BY col1
LIMIT 10 OFFSET 20;
Логический порядок исполнения:
1. FROM / JOIN -- какие таблицы, как соединить
2. WHERE -- фильтр строк ДО группировки
3. GROUP BY -- группировка
4. HAVING -- фильтр групп ПОСЛЕ агрегации
5. SELECT -- вычисление выражений, алиасов
6. DISTINCT -- удаление дублей
7. ORDER BY -- сортировка
8. LIMIT / OFFSET -- срез
⚠️ Ловушка: алиас из SELECT нельзя использовать в WHERE (т.к. WHERE выполняется раньше SELECT), но можно в ORDER BY и часто в GROUP BY (зависит от СУБД). Пример ошибки:
SELECT salary * 12 AS annual FROM emp WHERE annual > 100000; -- ОШИБКА
SELECT salary * 12 AS annual FROM emp ORDER BY annual; -- ОК
Что такое оконные функции и чем они отличаются от GROUP BY?
Что такое оконные функции и чем они отличаются от GROUP BY?
Короткий ответ: Оконная функция считает агрегат по «окну» строк, но при этом не схлопывает строки — каждая исходная строка сохраняется и получает своё значение. GROUP BY, наоборот, сворачивает группу в одну строку.
Подробно:
- GROUP BY — N строк группы → 1 строка результата. Деталь теряется.
- Оконная функция — N строк остаются N строками, рядом появляется агрегат (сумма, ранг, среднее, lag).
- Синтаксис —
func() OVER (PARTITION BY ... ORDER BY ...).PARTITION BYзадаёт группы,ORDER BY— порядок внутри окна (нужен для нарастающих итогов и рангов).
-- Нарастающий итог продаж по каждому пользователю
SELECT
user_id,
order_date,
amount,
SUM(amount) OVER (
PARTITION BY user_id
ORDER BY order_date
) AS running_total
FROM orders;
⚠️ Частая ошибка: пытаться отфильтровать по результату оконной функции в WHERE — окна вычисляются после WHERE/GROUP BY, поэтому заворачивайте запрос в CTE/подзапрос и фильтруйте снаружи.
Чем отличаются среднее, медиана и мода, и почему для скошенных данных (доход, время отклика) лучше брать медиану?
Чем отличаются среднее, медиана и мода, и почему для скошенных данных (доход, время отклика) лучше брать медиану?
Короткий ответ: Среднее — сумма, делённая на количество, чувствительно к выбросам. Медиана — центральное значение упорядоченного ряда, устойчива к выбросам. Мода — самое частое значение. Для скошенных данных медиана точнее отражает «типичное» наблюдение.
Подробно:
- Среднее (mean) — хорошо для симметричных данных и для дальнейших расчётов (дисперсия, регрессия), но один выброс сдвигает его.
- Медиана — 50-й перцентиль; делит данные пополам и почти не реагирует на экстремумы.
- Мода — единственная метрика для категориальных данных («самый частый тариф»).
| Метрика | Когда применять | Чувствительность к выбросам |
|---|---|---|
| Среднее | симметричные данные, дальнейшие расчёты | высокая |
| Медиана | скошенные данные: доход, время отклика, цены | низкая |
| Мода | категориальные данные, самое частое значение | низкая |
⚠️ Частая ошибка: отчитываться средним по доходу или времени отклика. Длинный правый хвост тянет среднее вверх, и оно перестаёт описывать типичного пользователя — берите медиану.
Как устроен A/B-тест от начала до конца? Опишите ключевые этапы.
Как устроен A/B-тест от начала до конца? Опишите ключевые этапы.
Короткий ответ: A/B-тест — это рандомизированный эксперимент: пользователей случайно делят на контроль и тритмент, показывают разные версии и сравнивают одну заранее выбранную первичную метрику по фиксированному правилу решения.
Подробно:
- Гипотеза — что меняем, на какую метрику влияем и почему.
- Метрика и MDE — одна первичная метрика плюс минимально детектируемый эффект (MDE).
- Рандомизация — случайное и устойчивое разбиение на контроль/тритмент.
- Размер выборки и длительность — считаем и фиксируем до старта.
- Запуск до N — крутим до набора выборки, не подглядывая в промежуточные итоги.
- Анализ — сравниваем метрику, считаем p-значение и доверительный интервал лифта.
- Решение — выкатываем или откатываем по заранее заданному правилу.
Гипотеза → Рандомизация → Запуск до N → Анализ → Решение
│ │
контроль / тритмент выкатить ✓ / откатить ✗
⚠️ Частая ошибка: менять интерфейс по ходу теста или останавливать его в первый момент «значимости» — и то и другое ломает выводы.
Что делает метрику хорошей и чем метрика отличается от KPI?
Что делает метрику хорошей и чем метрика отличается от KPI?
Короткий ответ: Хорошая метрика измерима, сравнима, понятна и трудно поддаётся накрутке (gameable), а главное — actionable: по ней можно принять решение. KPI — это та же метрика, но привязанная к цели и целевому значению на период; KPI — подмножество метрик, а не синоним.
Подробно:
- Actionable, а не vanity — метрика должна менять чьё-то решение. Если число выросло, но никто не знает, что делать, — это vanity-метрика.
- Сравнимость — используй ставки и отношения (конверсия, retention %), а не абсолютные счётчики: они сопоставимы между периодами и сегментами.
- Устойчивость к накрутке — спрашивай «как это можно нагнать, не создав ценности?». «Клики» легко накрутить, «активированные пользователи» — труднее.
- Ясное определение — один числитель, один знаменатель, окно и фильтры зафиксированы, иначе две команды считают по-разному.
| Свойство | Метрика | KPI |
|---|---|---|
| Что это | любое измеримое число | метрика с целью |
| Привязка к цели | не обязательно | обязательно (target) |
| Сколько штук | много | единицы, отобранные |
| Пример | время на странице | activation rate ≥ 40% к Q3 |
⚠️ Частая ошибка: называть KPI всё подряд. KPI — это 3–5 метрик, по которым команду реально оценивают; остальное — диагностические метрики.
Как выбрать тип графика под задачу: столбики, линия, точечная или круговая диаграмма?
Как выбрать тип графика под задачу: столбики, линия, точечная или круговая диаграмма?
Короткий ответ: Тип графика диктует не вкус, а характер связи в данных: сравнение категорий — столбики, динамика во времени — линия, корреляция двух величин — диаграмма рассеяния, доля немногих частей в целом — круговая. Если сомневаешься между круговой и чем-то ещё — почти всегда выбирай столбики.
Подробно:
Сначала формулируешь, какую связь показываешь, и только потом выбираешь визуализацию:
| Связь в данных | Тип графика | Почему |
|---|---|---|
| Сравнение категорий | Столбчатая | глаз точно сравнивает длину; ось обязана начинаться с 0 |
| Динамика во времени | Линейная | линия подчёркивает тренд и непрерывность |
| Корреляция X и Y | Точечная (scatter) | видно облако, кластеры и выбросы |
| Доля частей в целом | Круговая / стек | только при 2–4 частях, сумма = 100% |
| Распределение | Гистограмма / boxplot | видно форму, разброс, хвосты |
- Столбики — рабочая лошадка для категорий; ось Y начинается с нуля, иначе разница в высоте врёт.
- Линия — только для упорядоченной непрерывной оси (время, дни); не соединяй линией несвязанные категории.
- Scatter — для «связаны ли X и Y», добавь линию тренда при необходимости.
⚠️ Частая ошибка: круговая диаграмма с 8 секторами — доли на ней неразличимы; замени на горизонтальные столбики, отсортированные по величине.
Готовы лучше запоминать?
Посмотрите пример, выберите направление и настройте регулярную практику под свою подготовку.
Вопросы об этом направлении
Как готовиться к собеседованию на «Аналитик данных»?
Учите концепции, которые придётся объяснять, а не только те, что умеете кодить. Направление «Аналитик данных» в RecallDeck даёт 265+ отобранных вопросов и возвращает каждый по расписанию в стиле Anki (SM-2), основанному на ваших оценках — чтобы тренировать вспоминание и объяснение. Дополняйте повторения кодингом и пробными собеседованиями.
Какие темы охватывает направление «Аналитик данных»?
Направление «Аналитик данных» разбито на ключевые области, которые реально проверяют на таких собеседованиях, — по темам и уровню сложности (Concept, Junior, Middle, Senior). Полный план и примеры вопросов можно посмотреть выше до входа.
Помогает ли интервальное повторение в подготовке к «Аналитик данных»?
Да. Активное вспоминание и честная самооценка помогают закреплять знания. RecallDeck назначает повторения карт по направлению «Аналитик данных» на основе ваших оценок: знакомые карты возвращаются реже, а сложные получают больше практики.
Можно попробовать направление «Аналитик данных» до оплаты?
Новым подписчикам месячного или годового тарифа может быть доступен пробный период семь дней со всем направлением «Аналитик данных» и всеми функциями. Право на него и сумму подтвердит страница оплаты; при повторной подписке списание может быть сразу. Отмените подписку онлайн до конца пробного периода, чтобы избежать первого списания. У вечного доступа пробного периода нет.