Ищем Senior DevOps Observability Engineer в международную продуктовую компанию из сферы iGaming.
Нужен сильный DevOps-инженер с актуальным production-опытом Kubernetes и глубокой практикой в observability, мониторинге и работе с production-инцидентами.
Задачи:
- обеспечивать надежную работу приложений в Kubernetes в production
- диагностировать инциденты и проблемы в Kubernetes-кластерах и распределенных системах
- развивать Observability-платформу для metrics, logs и traces
работать с VictoriaMetrics, Grafana, Loki, Tempo, Mimir, ELK, OpenTelemetry и другими инструментами observability
- развивать мониторинг, алертинг и дашборды с учетом архитектуры сервисов
- поддерживать и развивать Observability-стратегию, стандартизировать подходы для инженерных команд
- участвовать в полном цикле работы с production-инцидентами - от OnCall и восстановления сервисов до RCA/Post-Mortem
- внедрять reliability improvements по итогам инцидентов и снижать вероятность их повторения
- взаимодействовать с development/backend и другими инженерными командами
Хотим увидеть в вашем опыте:
- от 3 лет опыта в роли DevOps Engineer
- сильный недавний практический опыт Kubernetes в production
- опыт troubleshooting и устранения инцидентов в Kubernetes-кластерах
- опыт самостоятельной разработки и поддержки Helm charts - шаблонизация, функции, собственные charts разного уровня сложности
- практический опыт построения и развития monitoring/observability
- опыт с Grafana, VictoriaMetrics/Prometheus, Loki, ELK, OpenTelemetry или сопоставимым стеком
опыт работы с production-инцидентами, RCA/Post-Mortem и последующими reliability improvements
- опыт CI/CD и GitOps - GitLab CI/CD, Argo CD или сопоставимые инструменты