Направление

Подготовка к собеседованию — Аналитик данных

Колода из 265+ карточек с вопросами для собеседования по направлению «Аналитик данных» — по темам и уровню сложности, с повторениями по вашим оценкам. Посмотрите несколько карточек ниже, затем выберите доступ, чтобы учить всё направление по расписанию в стиле Anki (SM-2).

265 карточек13 тем
Посмотреть цены и начать

Новым подписчикам месяца или года может быть доступно 7 дней бесплатно. Условия и сумму подтвердит страница оплаты.

С чего начать

Начните с основ SQL, арифметики и статистики. Для модулей Python и pandas нужно читать простой Python-код; параллельно практикуйте запросы и анализ на небольшом наборе данных.

Первый проход: Базы данных → SQL для аналитики. Начните с базовых вопросов в этих модулях, затем продолжайте по плану. К сложным и senior-вопросам возвращайтесь по требованиям вакансии; все карточки доступны с самого начала.

Общие темы могут входить в несколько направлений и сохраняют одну историю повторений. План ниже отмечает общие основы и профильные модули; выбирайте глубину под свою вакансию.

Что внутри

Все темы направления, сгруппированные так, как вы будете их учить.

Базы данных

42 карточки

Общие основы

Основы SQL

SQL для аналитики

11 карточек

Профильный модуль

SQL для аналитики

Статистика и вероятность

11 карточек

Профильный модуль

Статистика

A/B-тесты и эксперименты

9 карточек

Профильный модуль

Эксперименты

Продуктовые и бизнес-метрики

10 карточек

Профильный модуль

Метрики

Визуализация данных и сторителлинг

8 карточек

Профильный модуль

Визуализация

Python

122 карточки

Общие основы

Ядро языкаМодель данных и внутренностиКонкурентность и asyncStdlib, типизация и тесты

Python для аналитиков (pandas и matplotlib)

10 карточек

Профильный модуль

Python для аналитиков

Аналитические кейсы

7 карточек

Профильный модуль

Кейсы

Поведенческое интервью

35 карточек

Общие основы

Поведенческое интервью

Примеры вопросов

Несколько карточек из колоды — откройте ответ, затем выберите доступ, чтобы учить весь набор по расписанию.

Что делает SELECT и в каком порядке выполняются части запроса?

Короткий ответ: SELECT извлекает строки из таблиц. Логический порядок выполнения НЕ совпадает с порядком написания: сначала FROM, затем WHERE, GROUP BY, HAVING, SELECT, DISTINCT, ORDER BY, LIMIT.

Подробно:

Порядок написания (синтаксический):

SELECT   DISTINCT col1, agg(col2)
FROM     t
WHERE    cond
GROUP BY col1
HAVING   agg_cond
ORDER BY col1
LIMIT    10 OFFSET 20;

Логический порядок исполнения:

1. FROM / JOIN      -- какие таблицы, как соединить
2. WHERE            -- фильтр строк ДО группировки
3. GROUP BY         -- группировка
4. HAVING           -- фильтр групп ПОСЛЕ агрегации
5. SELECT           -- вычисление выражений, алиасов
6. DISTINCT         -- удаление дублей
7. ORDER BY         -- сортировка
8. LIMIT / OFFSET   -- срез

⚠️ Ловушка: алиас из SELECT нельзя использовать в WHERE (т.к. WHERE выполняется раньше SELECT), но можно в ORDER BY и часто в GROUP BY (зависит от СУБД). Пример ошибки:

SELECT salary * 12 AS annual FROM emp WHERE annual > 100000; -- ОШИБКА
SELECT salary * 12 AS annual FROM emp ORDER BY annual;        -- ОК

Что такое оконные функции и чем они отличаются от GROUP BY?

Короткий ответ: Оконная функция считает агрегат по «окну» строк, но при этом не схлопывает строки — каждая исходная строка сохраняется и получает своё значение. GROUP BY, наоборот, сворачивает группу в одну строку.

Подробно:

  1. GROUP BY — N строк группы → 1 строка результата. Деталь теряется.
  2. Оконная функция — N строк остаются N строками, рядом появляется агрегат (сумма, ранг, среднее, lag).
  3. Синтаксис — func() OVER (PARTITION BY ... ORDER BY ...). PARTITION BY задаёт группы, ORDER BY — порядок внутри окна (нужен для нарастающих итогов и рангов).
-- Нарастающий итог продаж по каждому пользователю
SELECT
  user_id,
  order_date,
  amount,
  SUM(amount) OVER (
    PARTITION BY user_id
    ORDER BY order_date
  ) AS running_total
FROM orders;

⚠️ Частая ошибка: пытаться отфильтровать по результату оконной функции в WHERE — окна вычисляются после WHERE/GROUP BY, поэтому заворачивайте запрос в CTE/подзапрос и фильтруйте снаружи.

Чем отличаются среднее, медиана и мода, и почему для скошенных данных (доход, время отклика) лучше брать медиану?

Короткий ответ: Среднее — сумма, делённая на количество, чувствительно к выбросам. Медиана — центральное значение упорядоченного ряда, устойчива к выбросам. Мода — самое частое значение. Для скошенных данных медиана точнее отражает «типичное» наблюдение.

Подробно:

  1. Среднее (mean) — хорошо для симметричных данных и для дальнейших расчётов (дисперсия, регрессия), но один выброс сдвигает его.
  2. Медиана — 50-й перцентиль; делит данные пополам и почти не реагирует на экстремумы.
  3. Мода — единственная метрика для категориальных данных («самый частый тариф»).
Метрика Когда применять Чувствительность к выбросам
Среднее симметричные данные, дальнейшие расчёты высокая
Медиана скошенные данные: доход, время отклика, цены низкая
Мода категориальные данные, самое частое значение низкая

⚠️ Частая ошибка: отчитываться средним по доходу или времени отклика. Длинный правый хвост тянет среднее вверх, и оно перестаёт описывать типичного пользователя — берите медиану.

Как устроен A/B-тест от начала до конца? Опишите ключевые этапы.

Короткий ответ: A/B-тест — это рандомизированный эксперимент: пользователей случайно делят на контроль и тритмент, показывают разные версии и сравнивают одну заранее выбранную первичную метрику по фиксированному правилу решения.

Подробно:

  1. Гипотеза — что меняем, на какую метрику влияем и почему.
  2. Метрика и MDE — одна первичная метрика плюс минимально детектируемый эффект (MDE).
  3. Рандомизация — случайное и устойчивое разбиение на контроль/тритмент.
  4. Размер выборки и длительность — считаем и фиксируем до старта.
  5. Запуск до N — крутим до набора выборки, не подглядывая в промежуточные итоги.
  6. Анализ — сравниваем метрику, считаем p-значение и доверительный интервал лифта.
  7. Решение — выкатываем или откатываем по заранее заданному правилу.
Гипотеза → Рандомизация → Запуск до N → Анализ → Решение
              │                                    │
       контроль / тритмент              выкатить ✓ / откатить ✗

⚠️ Частая ошибка: менять интерфейс по ходу теста или останавливать его в первый момент «значимости» — и то и другое ломает выводы.

Что делает метрику хорошей и чем метрика отличается от KPI?

Короткий ответ: Хорошая метрика измерима, сравнима, понятна и трудно поддаётся накрутке (gameable), а главное — actionable: по ней можно принять решение. KPI — это та же метрика, но привязанная к цели и целевому значению на период; KPI — подмножество метрик, а не синоним.

Подробно:

  1. Actionable, а не vanity — метрика должна менять чьё-то решение. Если число выросло, но никто не знает, что делать, — это vanity-метрика.
  2. Сравнимость — используй ставки и отношения (конверсия, retention %), а не абсолютные счётчики: они сопоставимы между периодами и сегментами.
  3. Устойчивость к накрутке — спрашивай «как это можно нагнать, не создав ценности?». «Клики» легко накрутить, «активированные пользователи» — труднее.
  4. Ясное определение — один числитель, один знаменатель, окно и фильтры зафиксированы, иначе две команды считают по-разному.
Свойство Метрика KPI
Что это любое измеримое число метрика с целью
Привязка к цели не обязательно обязательно (target)
Сколько штук много единицы, отобранные
Пример время на странице activation rate ≥ 40% к Q3

⚠️ Частая ошибка: называть KPI всё подряд. KPI — это 3–5 метрик, по которым команду реально оценивают; остальное — диагностические метрики.

Как выбрать тип графика под задачу: столбики, линия, точечная или круговая диаграмма?

Короткий ответ: Тип графика диктует не вкус, а характер связи в данных: сравнение категорий — столбики, динамика во времени — линия, корреляция двух величин — диаграмма рассеяния, доля немногих частей в целом — круговая. Если сомневаешься между круговой и чем-то ещё — почти всегда выбирай столбики.

Подробно:

Сначала формулируешь, какую связь показываешь, и только потом выбираешь визуализацию:

Связь в данных Тип графика Почему
Сравнение категорий Столбчатая глаз точно сравнивает длину; ось обязана начинаться с 0
Динамика во времени Линейная линия подчёркивает тренд и непрерывность
Корреляция X и Y Точечная (scatter) видно облако, кластеры и выбросы
Доля частей в целом Круговая / стек только при 2–4 частях, сумма = 100%
Распределение Гистограмма / boxplot видно форму, разброс, хвосты
  • Столбики — рабочая лошадка для категорий; ось Y начинается с нуля, иначе разница в высоте врёт.
  • Линия — только для упорядоченной непрерывной оси (время, дни); не соединяй линией несвязанные категории.
  • Scatter — для «связаны ли X и Y», добавь линию тренда при необходимости.

⚠️ Частая ошибка: круговая диаграмма с 8 секторами — доли на ней неразличимы; замени на горизонтальные столбики, отсортированные по величине.

Готовы лучше запоминать?

Посмотрите пример, выберите направление и настройте регулярную практику под свою подготовку.

Вопросы об этом направлении

Как готовиться к собеседованию на «Аналитик данных»?

Учите концепции, которые придётся объяснять, а не только те, что умеете кодить. Направление «Аналитик данных» в RecallDeck даёт 265+ отобранных вопросов и возвращает каждый по расписанию в стиле Anki (SM-2), основанному на ваших оценках — чтобы тренировать вспоминание и объяснение. Дополняйте повторения кодингом и пробными собеседованиями.

Какие темы охватывает направление «Аналитик данных»?

Направление «Аналитик данных» разбито на ключевые области, которые реально проверяют на таких собеседованиях, — по темам и уровню сложности (Concept, Junior, Middle, Senior). Полный план и примеры вопросов можно посмотреть выше до входа.

Помогает ли интервальное повторение в подготовке к «Аналитик данных»?

Да. Активное вспоминание и честная самооценка помогают закреплять знания. RecallDeck назначает повторения карт по направлению «Аналитик данных» на основе ваших оценок: знакомые карты возвращаются реже, а сложные получают больше практики.

Можно попробовать направление «Аналитик данных» до оплаты?

Новым подписчикам месячного или годового тарифа может быть доступен пробный период семь дней со всем направлением «Аналитик данных» и всеми функциями. Право на него и сумму подтвердит страница оплаты; при повторной подписке списание может быть сразу. Отмените подписку онлайн до конца пробного периода, чтобы избежать первого списания. У вечного доступа пробного периода нет.

Другие направления