мониторинг и SRE Все курсы

✻ Тема 5 из 5

Надёжность и инциденты

SRE на практике: пережить сбой, разобрать его и не допустить снова

⏱ 12 ч 4 уроков 0/4 пройдено

О чём тема

Мониторинг нужен не ради графиков, а чтобы сервис работал. Эта тема про то, что делает SRE, когда графики покраснели: как провести инцидент и не сделать хуже, как разобрать его без поиска виноватых, какие приёмы в коде и архитектуре не дают одному сбою положить всё, и как выкатывать изменения и восстанавливаться после аварии.

Иди по порядку: учебный инцидент из первого урока ты разбираешь во втором, а паттерны и откаты из третьего и четвёртого урока становятся пунктами плана действий из постмортема. Практика идёт на том же стенде «Магазин», файлы складываются в ~/monitoring-lab.

Что ты сможешь после каждого урока

Уроки темы

  1. 5.1 Инцидент: от алерта до восстановления 3 ч
  2. 5.2 Постмортем: учиться на сбоях 3 ч
  3. 5.3 Паттерны надёжности и как их видно в мониторинге 3 ч
  4. 5.4 Изменения без аварий и аварийное восстановление 3 ч