✻ Тема 8 из 10
Наблюдаемость
Метрики, алерты, логи, трейсы, service mesh и цели надёжности
О чём тема
Метрики, алерты, логи, трейсы, service mesh и цели надёжности.
Если хочешь сначала разобрать основы мониторинга на другом стенде, начни с курса «Мониторинг и SRE». Уроки идут строго по порядку: каждый опирается только на пройденное. В каждом уроке есть практика, задание «сломай и почини» и вопросы с собеседований с разбором ответов.
Что ты сможешь после каждого урока
- 8.1 Наблюдаемость: три сигнала, SLI и SLO: Сначала решаем, что считать надёжностью (SLI, SLO, error budget), и только потом ставим инструменты.
- 8.2 Prometheus: сбор метрик и /metrics в «Заметках»: Prometheus сам опрашивает цели, а приложение отдаёт метрики на /metrics.
- 8.3 PromQL: rate, агрегации, квантили: Запросы к метрикам считают скорость, долю ошибок и p95, а типичные ошибки видны заранее.
- 8.4 Проверки снаружи: blackbox и exporters: Проверка снаружи ловит то, что не видно изнутри приложения.
- 8.5 Алерты и Alertmanager: правила, маршрутизация, runbook: Алерт сообщает о боли пользователя, приходит один раз и ведёт к runbook.
- 8.6 Grafana: дашборды как код: Дашборд отвечает на вопрос «что горит» и хранится в git, а не в голове.
- 8.7 Логи: JSON, Loki и Grafana Alloy: Структурные логи собираются в одном месте, а лейблы остаются низкой кардинальности.
- 8.8 Трейсинг: OpenTelemetry и Tempo: Трейс показывает путь одного запроса, а trace_id связывает логи, метрики и трейсы.
- 8.9 Мониторинг в Kubernetes: kube-prometheus-stack: Стек мониторинга ставится в кластер, а приложение подключается через ServiceMonitor.
- 8.10 Service mesh: Istio ambient: Mesh даёт mTLS, политики доступа и телеметрию без правок кода, но стоит ресурсов и сложности.
- 8.11 Надёжность: retry, circuit breaker и burn-rate алерты: Повторы с backoff и jitter, circuit breaker и burn-rate алерты защищают и сервис, и бюджет ошибок.
Уроки темы
- 8.1 Наблюдаемость: три сигнала, SLI и SLO 1.5 ч
- 8.2 Prometheus: сбор метрик и /metrics в «Заметках» 2 ч
- 8.3 PromQL: rate, агрегации, квантили 2 ч
- 8.4 Проверки снаружи: blackbox и exporters 1.5 ч
- 8.5 Алерты и Alertmanager: правила, маршрутизация, runbook 2 ч
- 8.6 Grafana: дашборды как код 2 ч
- 8.7 Логи: JSON, Loki и Grafana Alloy 2 ч
- 8.8 Трейсинг: OpenTelemetry и Tempo 2 ч
- 8.9 Мониторинг в Kubernetes: kube-prometheus-stack 2 ч
- 8.10 Service mesh: Istio ambient 2.5 ч
- 8.11 Надёжность: retry, circuit breaker и burn-rate алерты 2 ч