✻ Тема 7 из 13
Метрики, логи, трейсы и алерты
Глаза нагрузочника: без них тест показывает только, что стало плохо, но не почему
О чём тема
Глаза нагрузочника: без них тест показывает только, что стало плохо, но не почему.
Основы наблюдаемости (три сигнала, RED и USE, SLO, PromQL, алерты) подробно разобраны в курсе «Мониторинг и SRE». Здесь они применяются к нагрузке на «Магазин»: если понятие из урока незнакомо, загляни в соответствующий урок основ.
Иди по порядку: каждый урок опирается на предыдущий. После объяснения выполни практику на учебном стенде, затем задание «сломай и почини»: измени одно условие, найди причину сбоя и проверь исправление. Вопросы с собеседований помогут проверить, можешь ли ты объяснить результат своими словами.
Что ты сможешь после каждого урока
- 7.1 Метрики и Prometheus: типы метрик, сбор, /metrics: Найдёшь метрики сервиса в Prometheus и различишь их типы.
- 7.2 PromQL: rate, sum by, histogram_quantile: Напишешь PromQL-запрос для RPS и p95.
- 7.3 Grafana: дашборд RED и USE для «Магазина»: Соберёшь дашборд RED и USE в Grafana.
- 7.4 Экспортеры: хост, контейнеры и PostgreSQL: Подключишь метрики хоста, контейнеров и PostgreSQL через экспортеры.
- 7.5 Логи: уровни, структура, Loki и Alloy: Найдёшь логи проблемного запроса в Loki.
- 7.6 Алерты, Alertmanager и первый инцидент: Настроишь алерт и проверишь его на учебном инциденте.
- 7.7 Трейсы: путь одного запроса: Найдёшь трейс заказа в Grafana, перейдёшь из лога в трейс и узнаешь в водопаде медленную оплату и N+1.
Уроки темы
- 7.1 Метрики и Prometheus: типы метрик, сбор, /metrics 3 ч
- 7.2 PromQL: rate, sum by, histogram_quantile 3 ч
- 7.3 Grafana: дашборд RED и USE для «Магазина» 2.5 ч
- 7.4 Экспортеры: хост, контейнеры и PostgreSQL 3.5 ч
- 7.5 Логи: уровни, структура, Loki и Alloy 2.5 ч
- 7.6 Алерты, Alertmanager и первый инцидент 3 ч
- 7.7 Трейсы: путь одного запроса 3.5 ч