Перейти к основному содержимому

Вопросы на собеседовании

Вопросы на собеседовании SRE-инженера

25 вопросов на собеседовании SRE-инженера: SLI/SLO и error budget, Kubernetes, observability, IaC и CI/CD, инциденты, постмортемы и надёжность систем.

Поделиться:TGVKWA
SLI/SLO и error budgetKubernetesObservability (Prometheus, Grafana)IaC (Terraform, Ansible)CI/CDLinux и сетиУправление инцидентамиПрограммирование (Python, Go)

📈 Готовитесь к собеседованию? Получайте свежие вакансии SRE-инженер на почту или в Telegram — и откликайтесь, пока подготовка свежая.

бесплатно
Бесплатно, без регистрации

Мини-собеседование: SRE-инженер

Прочитать вопросы мало — на интервью придётся говорить. Ответьте на один вопрос своими словами, 2–3 предложений хватит, и ИИ разберёт ответ по четырём критериям: структура, конкретика, релевантность, убедительность.

123
Технический вопросДля всех уровней

Что такое SLI, SLO и SLA и чем они отличаются друг от друга?

2–3 предложения достаточно · ещё 20 симв.

Типовые вопросы и подсказки к ответам

Используйте подсказки как каркас ответа: добавьте свои проекты, метрики, ограничения и выводы. Любой вопрос можно тут же проговорить — кнопка «Ответить и получить разбор ИИ» отправит его в мини-собеседование выше.

Технический вопрос

Вопрос 1Для всех уровней

Что такое SLI, SLO и SLA и чем они отличаются друг от друга?

Показать подсказку ▾

Как отвечать: Разведите три понятия: SLI — измеряемый показатель (доступность, латентность), SLO — внутренняя цель, SLA — внешнее обязательство с санкциями. Приведите пример из практики.

Вопрос 2Middle

Что такое error budget и как он влияет на работу команды разработки?

Показать подсказку ▾

Как отвечать: Объясните бюджет ошибок как допустимый объём недоступности из SLO, и как его исчерпание замораживает релизы в пользу работы над стабильностью.

Вопрос 3Middle

Как вы выберете SLI для сервиса, у которого раньше не было целей по надёжности?

Показать подсказку ▾

Как отвечать: Начните с пользовательского опыта: доступность, латентность, доля ошибок. Опишите, как валидируете метрику с владельцем продукта и избегаете метрик ради метрик.

Вопрос 4Для всех уровней

Что такое toil и как вы с ним боретесь?

Показать подсказку ▾

Как отвечать: Дайте определение ручной повторяемой работы без долгосрочной ценности, приведите примеры автоматизации из опыта и цель Google — не более 50% времени на toil.

Вопрос 5Middle

Чем мониторинг отличается от наблюдаемости (observability)?

Показать подсказку ▾

Как отвечать: Объясните: мониторинг отвечает на известные заранее вопросы, observability позволяет исследовать неизвестные проблемы через метрики, логи и трейсы. Упомяните три столпа.

Вопрос 6Для всех уровней

Как устроен Kubernetes и что происходит, когда вы делаете kubectl apply?

Показать подсказку ▾

Как отвечать: Пройдите цепочку: API-сервер, etcd, scheduler, kubelet и контейнерный рантайм. Покажите понимание control plane и того, где искать сбой на каждом шаге.

Вопрос 7Middle

Под в Kubernetes уходит в CrashLoopBackOff. Как вы будете диагностировать?

Показать подсказку ▾

Как отвечать: Покажите методичность: kubectl describe и logs, проверка liveness/readiness-проб, ресурсов и лимитов, образа и конфигов — от симптома к первопричине.

Вопрос 8Middle

Как вы управляете ресурсами контейнеров: requests, limits, HPA?

Показать подсказку ▾

Как отвечать: Расскажите про requests и limits для CPU/памяти, QoS-классы подов, настройку HPA по метрикам и типичные ошибки — OOMKilled из-за заниженных лимитов.

Вопрос 9Middle

Как вы описываете инфраструктуру кодом и почему это важно для надёжности?

Показать подсказку ▾

Как отвечать: Приведите опыт с Terraform или Ansible: декларативность, воспроизводимость окружений, code review изменений инфраструктуры и снижение configuration drift.

Вопрос 10Middle

Как вы выстраиваете CI/CD-пайплайн, чтобы релизы были частыми, но безопасными?

Показать подсказку ▾

Как отвечать: Упомяните автотесты, канареечные и blue-green деплои, feature flags, автоматический откат по метрикам и связь с error budget.

Вопрос 11Senior

Как вы организуете секреты и доступы в инфраструктуре?

Показать подсказку ▾

Как отвечать: Расскажите про Vault или аналоги, ротацию секретов, принцип минимальных привилегий, RBAC в Kubernetes и аудит доступа.

Вопрос 12Для всех уровней

Как вы настраиваете алертинг, чтобы он будил людей только по делу?

Показать подсказку ▾

Как отвечать: Ключевая идея — алерты на симптомы для пользователя, а не на каждую метрику: связь с SLO, приоритизация, устранение шума, эскалация и дежурства.

Вопрос 13Middle

Какие инструменты observability вы использовали и как строите дашборды?

Показать подсказку ▾

Как отвечать: Назовите реальный стек: Prometheus и PromQL, Grafana, Loki или ELK для логов, Jaeger или Tempo для трейсов. Покажите, как дашборд отвечает на вопросы об SLO.

Вопрос 14Middle

Как вы проводите постмортем после крупного инцидента?

Показать подсказку ▾

Как отвечать: Опишите blameless-подход: хронология, первопричина и способствующие факторы, конкретные action items с владельцами и сроками — без поиска виноватых.

Вопрос 15Middle

Как вы подходите к capacity planning и прогнозированию нагрузки?

Показать подсказку ▾

Как отвечать: Расскажите про анализ трендов, нагрузочное тестирование, запас мощности под пиковые события (распродажи, сезонность) и автомасштабирование.

Вопрос 16Senior

Как вы определяете SLO и error budget для критичного сервиса?

Показать подсказку ▾

Как отвечать: Назовите выбор SLI — доступность и латентность, целевые значения SLO по боли пользователей, расчёт error budget, алертинг на скорость расхода и политику релизов при его исчерпании.

Резюме открывают раньше, чем зовут на собеседование. Соберите версию под «SRE-инженер» с ИИ — около 10 минут, начать можно бесплатно.

Резюме под эту роль

Кейс

Вопрос 1Senior

SLO по доступности сервиса — 99,9%. Сколько это минут простоя в месяц и как вы используете эту цифру?

Показать подсказку ▾

Как отвечать: Посчитайте (примерно 43 минуты в месяц), свяжите с error budget и покажите, как он влияет на решения: канареечные релизы, скорость выкатки, приоритеты задач.

Вопрос 2Для всех уровней

Кейс: пользователи жалуются на медленную работу сервиса, но все метрики инфраструктуры в норме. Ваши действия?

Показать подсказку ▾

Как отвечать: Покажите работу с распределённой системой: трейсинг запроса, латентность по перцентилям (p95, p99), внешние зависимости и база данных — а не только CPU и память.

Вопрос 3Senior

Кейс: нужно повысить надёжность legacy-сервиса, который нельзя переписать. С чего начнёте?

Показать подсказку ▾

Как отвечать: Покажите прагматизм: сначала наблюдаемость и алерты, затем устранение единых точек отказа, runbook-и, изоляция сбоев — и только потом архитектурные изменения.

Поведенческий вопрос

Вопрос 1Для всех уровней

Расскажите о самом тяжёлом инциденте, который вы разбирали.

Показать подсказку ▾

Как отвечать: Ответьте по STAR: масштаб и влияние на пользователей, ваши действия в роли incident-реагирующего, результат и что изменили в системе после постмортема.

Вопрос 2Middle

Как вы реагируете, когда разработчики считают требования SRE бюрократией, которая мешает релизам?

Показать подсказку ▾

Как отвечать: Покажите партнёрскую позицию: объяснение через error budget и пользовательский опыт, поиск компромисса и встраивание надёжности в процесс, а не запреты.

Вопрос 3Middle

Приходилось ли вам отказываться от релиза или останавливать выкатку? Расскажите, как это было.

Показать подсказку ▾

Как отвечать: Приведите пример с аргументацией через метрики и риски, покажите, как сообщили решение команде и что предложили, чтобы релиз всё же состоялся.

Вопрос 4Для всех уровней

Как вы относитесь к дежурствам и ночным алертам?

Показать подсказку ▾

Как отвечать: Покажите зрелое отношение: дежурства — часть ответственности за сервис, но важно, чтобы алерты были осмысленными, а нагрузка распределялась справедливо.

Вопрос 5Middle

Расскажите о случае, когда ваша автоматизация заметно сократила ручную работу команды.

Показать подсказку ▾

Как отвечать: Дайте конкретику: что автоматизировали, сколько часов toil сэкономили, как измерили эффект и как команда приняла изменение.

Вопрос 6Для всех уровней

Как вы развиваетесь в профессии SRE и следите за изменениями в экосистеме?

Показать подсказку ▾

Как отвечать: Свяжите с практикой: домашний кластер или pet-проекты, книги (Google SRE Book), доклады и CNCF-ландшафт, опыт внедрения нового инструмента на прошлом месте.

Готовы отвечать — а резюме уже под эту роль?

До собеседования резюме ещё нужно открыть. Соберите адаптированное резюме для «SRE-инженер» за ~10 минут: ИИ сформулирует опыт, навыки и достижения под требования работодателей.

Собрать резюме под эту роль
PRO

Проверьте себя: первый разбор — бесплатно

Прочитать вопросы — это старт. Настоящая подготовка — проговорить ответ и услышать, что с ним не так. Первый разбор ИИ бесплатный и без регистрации, прямо на этой странице. Полная симуляция — в PRO или разово, без подписки.

  • Реальные вопросы по вашей роли
  • Разбор ответов с ИИ
  • Оценка и советы

План подготовки

  1. 1Повторите философию SRE: SLI/SLO/SLA, error budget, toil — уметь объяснить на примерах, а не по определениям из книги.
  2. 2Освежите Kubernetes: архитектура control plane, диагностика подов, requests/limits, HPA и типичные причины CrashLoopBackOff и OOMKilled.
  3. 3Подготовьте рассказ о своём стеке observability: Prometheus, Grafana, логи и трейсы — и как алерты связаны с SLO.
  4. 4Вспомните 2–3 инцидента из практики и разберите их по STAR, включая постмортем и конкретные изменения после.
  5. 5Пройдите пробное интервью в ИИ-тренажёре Rabota-Help и потренируйтесь спокойно рассуждать вслух на архитектурных кейсах.

Частые ошибки

  • Знать определения SLO и error budget, но не уметь применить их к реальному сервису или посчитать допустимый простой.
  • Сводить SRE к «сисадмину с Kubernetes» и не показывать инженерный подход: автоматизацию, программирование, устранение toil.
  • В разборе инцидентов искать виноватых вместо системного анализа причин — это противоречит blameless-культуре.
  • Настраивать алерты на всё подряд и не понимать, почему будить дежурного нужно только по пользовательским симптомам.
  • Не задать вопросов о зрелости процессов в компании: дежурства, постмортемы, соотношение toil и инженерной работы.
Практика интервью

От вопросов — к тренировке интервью

Прочитайте вопросы, выберите 5–7 самых сложных и пройдите пробное интервью. ИИ-интервьюер поможет структурировать ответы, проверить аргументацию и подготовиться к реальному разговору.

Открыть тренажёр для роли SRE-инженер
Навыки

Востребованные навыки SRE-инженера

Частота упоминания в вакансиях работодателей

Все навыки →
1
Python31%
2
Linux27%
3
Kubernetes27%
4
Prometheus27%
5
Ansible27%
6
Helm23%
7
Grafana23%
8
Docker19%
Специалисты

Профили SRE-инженера на Rabota-Help

Реальные специалисты, открытые к предложениям

Все специалисты →

Вы готовитесь к собеседованию. А работодатели уже ищут SRE-инженера.

Создайте анонимный публичный профиль — его найдут в Яндексе и Google, и предложения придут сами. Контакты скрыты, пока вы не решите иначе.

Создать анонимный профиль — бесплатно

Пройдите мини-собеседование, добавьте резюме на экране результата — профиль создадим за минуту, с вашего согласия.

Вы нанимаете SRE-инженера? Профили кандидатов и подбор для работодателей →

Вакансии

Свежие вакансии SRE-инженера: 207

Откройте подходящие предложения и откликнитесь после подготовки к собеседованию.

Смотреть вакансии →