Чем предстоит заниматься:
- Исследовать проблемы в коде, сервисах и инфраструктуре, определять причины инцидентов и объяснять их команде;
- Координировать устранение инцидентов, проводить разбор аварий (Postmortem), формировать Runbook'и и backlog технических улучшений;
- Распределять задачи внутри команды и контролировать их выполнение;
- Взаимодействовать со смежными техническими и продуктовыми командами;
- Уточнять требования, оценивать технические риски и контролировать качество их проработки;
- Организовывать процессы дежурств: поддерживать графики, регламенты, отчётность, процессы реагирования и эскалации;
- Участвовать в сложных инженерных исследованиях и решении технических задач в роли технического лида или ревьюера;
- Развивать практики управления инфраструктурой как кодом (Infrastructure as Code): внедрять и поддерживать Terraform, Ansible, Helm, GitOps и другие инструменты автоматизации.
Что для этого потребуется:
- Опыт работы SRE/DevOps Engineer от 5 лет;
- Опыт управления командой и процессами Incident Management от 2 лет;
- Опыт Backend разработки;
- Опыт настройки CI/CD и автоматизации инфраструктуры;
- Уверенные знания Linux, Docker, SQL, Bash/Python/PHP;
- Опыт работы с Kafka, Redis/Tarantool, MariaDB/MaxScale, ClickHouse;
- Опыт работы с Grafana, Prometheus, Zabbix, Sentry;
- Опыт использования AI-инструментов в инженерной работе.
Будет плюсом: