SRE — обеспечение надёжности систем
- Особенности: Linux, Kubernetes, Terraform, Prometheus, Grafana, CI/CD, автоматизация инфраструктуры, работа с инцидентами
- Для кого: Базовые навыки администрирования Linux и понимание работы web-сервисов, желание автоматизировать инфраструктурные процессы и обеспечить отказоустойчивость систем
- Результат: Развернутый кластер Kubernetes, настроенная система автоматизированного мониторинга, сконфигурированный пайплайн CI/CD, документация по обработке инцидентов
- Важно знать: Высокий порог входа: отсутствие навыков работы в командной строке Linux (Bash) сделает усвоение программы затруднительным
- Плюсы: Методология управления бюджетом ошибок (Error Budgets) и выстраивание процессов post-mortem анализа для предотвращения повторных сбоев
- Что еще: Практическое внедрение количественных метрик надежности (SLI/SLO) и инструментов observability для управления доступностью сервисов
- Формат: Лекции онлайн, видеоуроки в записи, воркшопы
- Занятий: 8 часов в неделю
- Объем практики: 75%