✻ Тема 5 из 5
Надёжность и инциденты
SRE на практике: пережить сбой, разобрать его и не допустить снова
О чём тема
Мониторинг нужен не ради графиков, а чтобы сервис работал. Эта тема про то, что делает SRE, когда графики покраснели: как провести инцидент и не сделать хуже, как разобрать его без поиска виноватых, какие приёмы в коде и архитектуре не дают одному сбою положить всё, и как выкатывать изменения и восстанавливаться после аварии.
Иди по порядку: учебный инцидент из первого урока ты разбираешь во втором, а паттерны и откаты из третьего и четвёртого урока становятся пунктами плана действий из постмортема. Практика идёт на том же стенде «Магазин», файлы складываются в ~/monitoring-lab.
Что ты сможешь после каждого урока
- 5.1 Инцидент: от алерта до восстановления: Проведёшь учебный инцидент на «Магазине» по шагам: оценишь влияние, выберешь безопасную митигацию, напишешь статус и посчитаешь MTTD, MTTA и MTTR по хронологии.
- 5.2 Постмортем: учиться на сбоях: Напишешь постмортем без поиска виноватых, отличишь полезный пункт плана от бесполезного и посмотришь на сбой как на плохо управляемое взаимодействие, а не сломанную деталь.
- 5.3 Паттерны надёжности и как их видно в мониторинге: Объяснишь таймауты, повторы, circuit breaker, bulkhead и сброс нагрузки и узнаешь каждый по графикам, логам и трейсам.
- 5.4 Изменения без аварий и аварийное восстановление: Примешь решение об откате по бюджету ошибок и графикам после выкатки, отличишь canary от A/B и посчитаешь RTO и RPO для плана восстановления.