DEVOPS
TRAINER
Вопросы
/ Мониторинг
Вопросы по Мониторинг с собеседований
28 вопросов с ответами.
Какие методологии ведения проектов разработки ПО ты знаешь?
С какой технологией ты познакомился вчера, на этой неделе, в этом месяце?
Как мониторить состояние здоровья (Health Checks) контейнеров в Kubernetes (Liveness, Readiness, Startup пробы)?
Как вы узнаете, что контейнер завис, если он продолжает находиться в статусе `Running` (кастомные проверки, анализ логов)?
Как отслеживать истечение срока действия сертификатов внутри кластера Kubernetes?
Как организовать мониторинг баз данных (PostgreSQL, MySQL) и на какие метрики смотреть (время выполнения транзакций, нагрузка на диск, использование пула соединений)?
Ситуация: система мониторинга начала сильно тормозить и падать после добавления новых метрик от разработчиков. Ваши действия по дебагу?
Как настроить автоматическую генерацию тикетов в Jira при срабатывании критических алертов?
Как организовать корреляцию логов и метрик для ускорения расследования инцидентов?
Как организовать сбор логов в Kubernetes (стек EFK/ELK или Loki)?
В чем разница между хранением логов в Elasticsearch и Loki (индексация, потребление ресурсов)?
Как реализовать выборочный сбор логов только из определенных приложений в кластере (использование аннотаций, Sidecar-контейнеры, фильтрация в Fluent Bit)?
Где лучше хранить логи: краткосрочно и долгосрочно (например, Loki для оперативной работы и S3/Elastic для архива)?
Использовали ли вы инструменты для распределенной трассировки (Jaeger, Tempo)?
Как визуализировать карту взаимодействия сервисов (например, встроенными средствами Argo CD или через Service Mesh)?
Что такое SLA, SLO и SLI, и в чем разница между ними?
Какие метрики считаются обязательными (Golden Signals) для типичного веб-сервиса?
Как бороться с «алерт-шумом» и эффективно разделять каналы оповещений по критичности?
Зачем нужен Alertmanager, если в Grafana тоже можно настроить алертинг?
Из каких основных компонентов состоит стек Prometheus (сервер, Alertmanager, экспортеры)?
Что такое Write-Ahead Log (WAL) в Prometheus и сколько часов он живет по умолчанию?
Как работает механизм сбора метрик (Pull-модель): кто такие скраперы (scrapers) и как Prometheus узнает о новых целях?
Для чего нужен Pushgateway, и в каких случаях используется Push-модель вместо Pull?
Что такое комбинаторный взрыв (высокая кардинальность) метрик, и почему опасно добавлять user_id в метрики Prometheus/VictoriaMetrics?
Разница между Prometheus и VictoriaMetrics: почему в крупных проектах часто выбирают второе?
Как мониторить новую виртуальную машину или кластер Kubernetes (использование Node Exporter, Kube-state-metrics)?
В каких случаях целесообразно использовать Zabbix вместо Prometheus (например, для мониторинга «железа» и сетевого оборудования)?
Какие возможности предоставляет AWS CloudWatch (логи, метрики, алерты)?
Готовишься к DevOps-собеседованию?
Полные разборы вопросов, карточки с интервальным повторением, квизы и песочница с реальными сломанными Linux-серверами — бесплатно после входа.
Открыть тренажёр →