Site Reliability Engineer
Команда Infrastructure Platform предоставляет внутренние инструменты и облачные сервисы как услугу для всех продуктовых команд компании, обеспечивая масштабируемую и надежную основу для разработки. Мы не просто "чиним алерты" — мы проектируем платформу, автоматизируем процессы и напрямую влияем на развитие инженерных практик в компании.
Зоны ответственности в команде разделены на четыре фокуса: облачные ресурсы, Kubernetes, базы данных и мониторинг. Сейчас мы ищем коллегу, который будет ответственен за облачные ресурсы.
Стек технологий и процессы
- Основные технологии: Kubernetes, Terraform, Prometheus, Grafana Stack (Mimir, Alloy, Loki, Tempo, Pyroscope), GitOps/PaaS/IDP(Internal Development Platform), AI driven.
- Облачные платформы: Azure, Yandex Cloud, в будущем подключим SberCloud.
- Разработка: Чистый код (Go, Bash, Python) — это обязательная часть работы, а не просто написание скриптов.
- Процессы: Гибкая методология, еженедельные командные демо и митапы. Обязательное участие в инженерном дежурстве (on-call) примерно раз в 1.5 месяца (недельное дежурство с первичным реагированием на инциденты). Для ночных дежурств предусмотрена дополнительная оплата и день отдыха после.
Мы ожидаем
- От 5 лет коммерческого опыта в роли SRE/DevOps в продуктовых компаниях
- Умение видеть картину целиком, анализировать сложные распределенные системы и проектировать надежные решения.
- Умение самостоятельно ставить цели, принимать решения и доводить задачи до результата
- Способность ясно объяснять технические концепции, вести диалог с разными командами и аргументировать свою точку зрения.
- Практический опыт работы с Kubernetes, CI/CD, принципами мониторинга и инфраструктурой как код
- Готовность и способность писать качественный код для создания инструментов и автоматизации, а не только использовать готовые конфигурации.