мониторинг и SRE

Курс основ мониторинга, наблюдаемости и SRE

Узнай, что с сервисом, раньше пользователей

Метрики, логи, трейсы, SLO, Prometheus, Grafana и алерты: общая база для курсов DevOps и нагрузочного тестирования. Всё на учебном интернет-магазине, который ты поднимаешь у себя и сам наблюдаешь за ним.

  • 5 темыот сигналов до трейсов
  • 13 уроков≈39 часов практики
  • Бесплатнобез регистрации

О чём курс

База, на которой стоят два других курса

Без метрик и логов непонятно ни как живёт сервис, ни что показал нагрузочный тест. Здесь только основы, которые не зависят от Kubernetes и нагрузочных инструментов. Прикладное остаётся в курсах DevOps и нагрузочного тестирования, а уроки ссылаются на него в конце.

  1. 1

    Что и зачем мерить

    Метрики, логи и трейсы, методы RED и USE, SLI и SLO: как договориться, что сервис работает хорошо.

  2. 2

    Собирать и спрашивать

    Prometheus, PromQL и экспортёры: как числа попадают из сервиса в хранилище и как задавать им вопросы.

  3. 3

    Показывать и звать

    Дашборды Grafana и алерты: что видно с первого взгляда и когда будить человека.

Для кого

Для новичка после Linux и Docker

Терминал, curl и docker compose ты уже знаешь, остальное объясняется в уроках. Если этого пока нет, пройди эти темы в любом из курсов.

Что дальше. Прикладной мониторинг: тема 8 курса DevOps (проект «Заметки», Kubernetes, burn rate) и тема 7 курса нагрузочного тестирования (мониторинг под нагрузкой и разбор инцидента).

Стенд

Учебный магазин «Магазин»

Своего стенда у курса нет: практика идёт на магазине из курса нагрузочного тестирования. В нём уже есть Prometheus, Grafana, Alertmanager, Loki и Tempo, а внутри заложены поломки, которые надо заметить по приборам. Нагрузку и проверки давай только на свой локальный стенд.

Поднять стенд:

git clone https://github.com/distinguished-sre/learning.git ~/learning
cd ~/learning/load-tester/project/shop
cp .env.example .env
docker compose --profile monitoring up -d --build --wait

Prometheus откроется на localhost:9090, Grafana на localhost:3000, магазин на localhost:8000/docs. Свои запросы, дашборды и правила ты складываешь в репозиторий ~/monitoring-lab, его заводит урок 1.1.

Программа

5 темы, 13 уроков

Каждый урок опирается только на пройденное, поэтому идти лучше по порядку. Открой тему, чтобы увидеть уроки.

  1. 1 Что и зачем меритьТри сигнала, RED и USE, SLI и SLO: как договориться, что сервис работает хорошо 2 ур. · 5.5 ч
  2. 2 Метрики и PrometheusКак числа попадают из сервиса в хранилище и как задавать им вопросы 3 ур. · 9.5 ч
  3. 3 Дашборды и алертыУвидеть проблему глазами и узнать о ней раньше пользователя 2 ур. · 6 ч
  4. 4 Логи и трейсыПочему сломалось: от графика к строке лога и к пути одного запроса 2 ур. · 6 ч
  5. 5 Надёжность и инцидентыSRE на практике: пережить сбой, разобрать его и не допустить снова 4 ур. · 12 ч

Инструменты курса: Prometheus, PromQL, экспортёры, blackbox, Grafana, Alertmanager, Loki, Tempo

Подготовка к собеседованию

Начни с трёх сигналов

Первый урок объясняет, чем мониторинг отличается от наблюдаемости, и заводит рабочую папку. Дальше каждый урок добавляет по одному инструменту.

Начать с урока 1.1