Перейти к основному содержимому

Вопросы на собеседовании

Вопросы на собеседовании специалиста по Data Science

25 вопросов на собеседовании Data Scientist: метрики ML, feature engineering, переобучение, A/B-тесты, Python и pandas, ML в проде и кейсы.

Поделиться:TGVKWA
ML-метрикиFeature EngineeringA/B-экспериментыPython и pandasML в продеСтатистикаИнтерпретация моделей

📈 Готовитесь к собеседованию? Получайте свежие вакансии Data Scientist на почту или в Telegram — и откликайтесь, пока подготовка свежая.

бесплатно
Бесплатно, без регистрации

Мини-собеседование: Data Scientist

Прочитать вопросы мало — на интервью придётся говорить. Ответьте на один вопрос своими словами, 2–3 предложений хватит, и ИИ разберёт ответ по четырём критериям: структура, конкретика, релевантность, убедительность.

123
HR-вопросДля всех уровней

Почему вы выбрали карьеру в Data Science?

2–3 предложения достаточно · ещё 20 симв.

Типовые вопросы и подсказки к ответам

Используйте подсказки как каркас ответа: добавьте свои проекты, метрики, ограничения и выводы. Любой вопрос можно тут же проговорить — кнопка «Ответить и получить разбор ИИ» отправит его в мини-собеседование выше.

HR-вопрос

Вопрос 1Для всех уровней

Почему вы выбрали карьеру в Data Science?

Показать подсказку ▾

Как отвечать: Свяжите мотивацию с интересом к поиску закономерностей и влиянию на решения через данные; подкрепите конкретным проектом, который подтверждает выбор.

Вопрос 2Для всех уровней

Почему вы хотите работать Data Scientist именно в нашей компании?

Показать подсказку ▾

Как отвечать: Покажите изученность продукта и данных компании, соедините с вашим опытом в похожей предметной области и назовите задачи, где сможете дать эффект быстрее всего.

Резюме открывают раньше, чем зовут на собеседование. Соберите версию под «Data Scientist» с ИИ — около 10 минут, начать можно бесплатно.

Резюме под эту роль

Технический вопрос

Вопрос 1Junior

Чем precision отличается от recall и когда какая метрика важнее?

Показать подсказку ▾

Как отвечать: Разведите цену ложноположительных и ложноотрицательных ошибок; приведите примеры: антифрод и медицинская диагностика — и покажите, что выбор метрики диктует бизнес.

Вопрос 2Middle

Что такое ROC-AUC и какие у него ограничения при дисбалансе классов?

Показать подсказку ▾

Как отвечать: Объясните метрику через ранжирование; скажите, что при доле позитивного класса в доли процента ROC-AUC обманчиво оптимистичен, и назовите альтернативу — PR-AUC.

Вопрос 3Middle

Как обнаружить переобучение модели и как с ним бороться?

Показать подсказку ▾

Как отвечать: Назовите симптом: разрыв качества на обучении и валидации; перечислите приёмы: регуляризация, больше данных, упрощение модели, кросс-валидация, ранняя остановка.

Вопрос 4Middle

Что такое компромисс между смещением и разбросом (bias-variance tradeoff)?

Показать подсказку ▾

Как отвечать: Объясните на пальцах: простая модель недообучается, сложная запоминает шум; свяжите с выбором сложности модели и регуляризацией на практике.

Вопрос 5Middle

Как вы выбираете метрику качества под конкретную бизнес-задачу?

Показать подсказку ▾

Как отвечать: Покажите цепочку: бизнес-цель, цена ошибок каждого типа, метрика; подчеркните, что сначала договариваетесь о метрике с заказчиком, а не подгоняете её под результат.

Вопрос 6Middle

Что такое кросс-валидация и почему одного train/test split недостаточно?

Показать подсказку ▾

Как отвечать: Объясните k-fold и стратификацию; отдельно упомяните временной ряд — там нужна валидация «из прошлого в будущее», а не случайное разбиение.

Вопрос 7Junior

Как в pandas обработать пропуски и дубликаты в данных?

Показать подсказку ▾

Как отвечать: Назовите isnull, fillna со стратегиями, dropna, duplicated и drop_duplicates; важнее объяснить, как выбираете стратегию заполнения — по смыслу признака, а не «средним всегда».

Вопрос 8Middle

Приведите примеры feature engineering из ваших проектов. Что дало наибольший прирост?

Показать подсказку ▾

Как отвечать: Расскажите про агрегаты по окнам, производные признаки из дат и текста, взаимодействия признаков; подчеркните, что хорошие признаки рождаются из понимания предметной области.

Вопрос 9Middle

Как кодируете категориальные признаки и какие подводные камни у разных способов?

Показать подсказку ▾

Как отвечать: Сравните one-hot для низкой кардинальности, target encoding с риском утечки, embeddings; обязательно упомяните, что target encoding требует аккуратной валидации.

Вопрос 10Middle

Что такое утечка данных (data leakage)? Приведите примеры.

Показать подсказку ▾

Как отвечать: Назовите признаки из будущего, таргет, замаскированный под обычное поле, статистики, посчитанные по всей выборке до разбиения; объясните, почему это даёт ложно высокое качество.

Вопрос 11Junior

Какие SQL-запросы вы пишете в работе чаще всего?

Показать подсказку ▾

Как отвечать: Назовите выборки с JOIN и GROUP BY, оконные функции для агрегатов по пользователю, CTE для читаемости; покажите, что самостоятельно добываете данные для анализа.

Вопрос 12Senior

Как вы выбираете модель: с чего начинаете и когда усложняете?

Показать подсказку ▾

Как отвечать: Опишите подход от простого к сложному: бейзлайн и простые модели как ориентир, градиентный бустинг для табличных данных, нейросети при больших данных; критерий — прирост качества к цене внедрения.

Вопрос 13Middle

Как спроектировать A/B-эксперимент: размер выборки, длительность, метрики?

Показать подсказку ▾

Как отвечать: Пройдите по шагам: гипотеза и первичная метрика, расчёт выборки из MDE и мощности, рандомизация, фиксация срока заранее; предупредите о подглядывании в результаты.

Вопрос 14Middle

Объясните p-value и статистическую значимость простым языком.

Показать подсказку ▾

Как отвечать: Сформулируйте: вероятность получить такой или более сильный эффект при отсутствии реального; подчеркните, что значимость не равна практической важности, и упомяните доверительные интервалы.

Вопрос 15Middle

Что такое дрейф данных и дрейф концепции? Как их отслеживать?

Показать подсказку ▾

Как отвечать: Разведите изменение распределения входных признаков и изменение связи признаков с целевой переменной; назовите мониторинг распределений, PSI и качества на свежих данных.

Вопрос 16Senior

Как вы мониторите ML-модель в проде?

Показать подсказку ▾

Как отвечать: Перечислите слои: технические метрики сервиса, распределения входных данных и предсказаний, отложенное качество на размеченных данных, алерты; подчеркните, что модель без мониторинга — не продукт.

Вопрос 17Senior

Как организовать переобучение модели и откат при деградации?

Показать подсказку ▾

Как отвечать: Опишите конвейер: расписание или триггер по дрейфу, валидация кандидата против текущей модели, теневой режим, канареечный раскат и быстрый откат на предыдущую версию.

Вопрос 18Middle

Как вы объясняете бизнесу, почему модель выдала такой результат?

Показать подсказку ▾

Как отвечать: Назовите feature importance и SHAP для локальных объяснений, примеры на понятных заказчику кейсах; подчеркните перевод с языка модели на язык решений и денег.

Кейс

Вопрос 1Middle

Кейс: нужно построить модель оттока клиентов. Опишите план от постановки до внедрения.

Показать подсказку ▾

Как отвечать: Покажите сквозное мышление: определение оттока и горизонта, целевая переменная, данные и признаки, метрика и бейзлайн, пилот, интеграция предсказаний в процессы и измерение бизнес-эффекта.

Вопрос 2Middle

Кейс: A/B-тест показал +2% конверсии при p-value 0,04, но менеджер ожидал +10%. Как вы объясните результат?

Показать подсказку ▾

Как отвечать: Разведите статистическую значимость и ожидания: эффект реален, но мал; обсудите доверительный интервал, практическую ценность в деньгах и решение — раскатывать или искать более сильную гипотезу.

Вопрос 3Senior

Кейс: модель в проде начала деградировать через три месяца после запуска. Ваш план диагностики?

Показать подсказку ▾

Как отвечать: Опишите последовательность: проверка качества данных и пайплайна, анализ дрейфа признаков и концепции, сравнение сегментов, решение — переобучение, новые признаки или пересмотр постановки.

Поведенческий вопрос

Вопрос 1Middle

Расскажите о проекте, где ML не сработал. Что вы сделали и чему научились?

Показать подсказку ▾

Как отвечать: Честно разберите причину: данные, постановка, отсутствие бизнес-процесса под модель; покажите, что сообщили о проблеме рано и предложили альтернативу, а не тянули до дедлайна.

Вопрос 2Для всех уровней

Как вы объясняете технические ограничения нетехническому заказчику?

Показать подсказку ▾

Как отвечать: Покажите перевод в термины рисков и денег, работу с ожиданиями («модель не предскажет то, чего нет в данных») и договорённости о метриках успеха до старта работ.

Готовы отвечать — а резюме уже под эту роль?

До собеседования резюме ещё нужно открыть. Соберите адаптированное резюме для «Data Scientist» за ~10 минут: ИИ сформулирует опыт, навыки и достижения под требования работодателей.

Собрать резюме под эту роль
PRO

Проверьте себя: первый разбор — бесплатно

Прочитать вопросы — это старт. Настоящая подготовка — проговорить ответ и услышать, что с ним не так. Первый разбор ИИ бесплатный и без регистрации, прямо на этой странице. Полная симуляция — в PRO или разово, без подписки.

  • Реальные вопросы по вашей роли
  • Разбор ответов с ИИ
  • Оценка и советы

План подготовки

  1. 1Повторите метрики классификации и регрессии: precision/recall, PR-AUC против ROC-AUC — с примерами выбора под задачу.
  2. 2Разберите 2–3 своих проекта сквозным образом: постановка, данные, признаки, метрика, внедрение, эффект — к каждому будут вопросы.
  3. 3Освежите статистику для A/B-тестов: размер выборки, мощность, p-value, типичные ошибки экспериментов.
  4. 4Потренируйтесь писать SQL и pandas-код на живом задании: JOIN, GROUP BY, оконные функции, обработка пропусков.
  5. 5Подготовьте честную историю о неудачном проекте и выводах из него — это спрашивают почти всегда.
  6. 6Пройдите пробное интервью в тренажёре и проверьте, что ответы связывают модель с бизнес-эффектом, а не зависают на формулах.

Частые ошибки

  • Перечислять алгоритмы, не умея объяснить, почему выбрали конкретный и как измерили его пользу.
  • Не знать разницы между PR-AUC и ROC-AUC при дисбалансе классов — частый фильтр на middle.
  • Забывать про утечку данных и неправильную валидацию — это сразу выдаёт отсутствие боевого опыта.
  • Считать A/B-тест «посмотрели на конверсию», без расчёта выборки и фиксированного срока.
  • Не иметь ответа про мониторинг модели в проде: дрейф, отложенное качество, откат.
  • Объяснять результаты формулами там, где интервьюер ждёт языка денег и решений.
Практика интервью

От вопросов — к тренировке интервью

Прочитайте вопросы, выберите 5–7 самых сложных и пройдите пробное интервью. ИИ-интервьюер поможет структурировать ответы, проверить аргументацию и подготовиться к реальному разговору.

Открыть тренажёр для роли Data Scientist
Навыки

Востребованные навыки специалиста по Data Science

Частота упоминания в вакансиях работодателей

Все навыки →
1
Python12%
2
Машинное обучение4%
3
Java4%
4
FastAPI4%
5
Docker4%
6
Kafka4%
7
DevOps4%
8
gRPC4%

Вы готовитесь к собеседованию. А работодатели уже ищут специалиста по Data Science.

Создайте анонимный публичный профиль — его найдут в Яндексе и Google, и предложения придут сами. Контакты скрыты, пока вы не решите иначе.

Создать анонимный профиль — бесплатно

Пройдите мини-собеседование, добавьте резюме на экране результата — профиль создадим за минуту, с вашего согласия.

Вы нанимаете специалиста по Data Science? Профили кандидатов и подбор для работодателей →

Вакансии

Свежие вакансии специалиста по Data Science: 240

Откройте подходящие предложения и откликнитесь после подготовки к собеседованию.

Смотреть вакансии →