Курс основ мониторинга, наблюдаемости и SRE
Узнай, что с сервисом, раньше пользователей
Метрики, логи, трейсы, SLO, Prometheus, Grafana и алерты: общая база для курсов DevOps и нагрузочного тестирования. Всё на учебном интернет-магазине, который ты поднимаешь у себя и сам наблюдаешь за ним.
- 5 темыот сигналов до трейсов
- 13 уроков≈39 часов практики
- Бесплатнобез регистрации
О чём курс
База, на которой стоят два других курса
Без метрик и логов непонятно ни как живёт сервис, ни что показал нагрузочный тест. Здесь только основы, которые не зависят от Kubernetes и нагрузочных инструментов. Прикладное остаётся в курсах DevOps и нагрузочного тестирования, а уроки ссылаются на него в конце.
-
1
Что и зачем мерить
Метрики, логи и трейсы, методы RED и USE, SLI и SLO: как договориться, что сервис работает хорошо.
-
2
Собирать и спрашивать
Prometheus, PromQL и экспортёры: как числа попадают из сервиса в хранилище и как задавать им вопросы.
-
3
Показывать и звать
Дашборды Grafana и алерты: что видно с первого взгляда и когда будить человека.
Для кого
Для новичка после Linux и Docker
Терминал, curl и docker compose ты уже знаешь, остальное объясняется в уроках. Если этого пока нет, пройди эти темы в любом из курсов.
Курс нагрузочного тестирования
Что дальше. Прикладной мониторинг: тема 8 курса DevOps (проект «Заметки», Kubernetes, burn rate) и тема 7 курса нагрузочного тестирования (мониторинг под нагрузкой и разбор инцидента).
Стенд
Учебный магазин «Магазин»
Своего стенда у курса нет: практика идёт на магазине из курса нагрузочного тестирования. В нём уже есть Prometheus, Grafana, Alertmanager, Loki и Tempo, а внутри заложены поломки, которые надо заметить по приборам. Нагрузку и проверки давай только на свой локальный стенд.
Поднять стенд:
git clone https://github.com/distinguished-sre/learning.git ~/learning
cd ~/learning/load-tester/project/shop
cp .env.example .env
docker compose --profile monitoring up -d --build --wait
Prometheus откроется на localhost:9090, Grafana на localhost:3000, магазин на localhost:8000/docs. Свои запросы, дашборды и правила ты складываешь в репозиторий ~/monitoring-lab, его заводит урок 1.1.
Программа
5 темы, 13 уроков
Каждый урок опирается только на пройденное, поэтому идти лучше по порядку. Открой тему, чтобы увидеть уроки.
-
1 Что и зачем меритьТри сигнала, RED и USE, SLI и SLO: как договориться, что сервис работает хорошо
-
2 Метрики и PrometheusКак числа попадают из сервиса в хранилище и как задавать им вопросы
-
3 Дашборды и алертыУвидеть проблему глазами и узнать о ней раньше пользователя
-
4 Логи и трейсыПочему сломалось: от графика к строке лога и к пути одного запроса
-
5 Надёжность и инцидентыSRE на практике: пережить сбой, разобрать его и не допустить снова
Инструменты курса: Prometheus, PromQL, экспортёры, blackbox, Grafana, Alertmanager, Loki, Tempo
Начни с трёх сигналов
Первый урок объясняет, чем мониторинг отличается от наблюдаемости, и заводит рабочую папку. Дальше каждый урок добавляет по одному инструменту.