Site Reliability Engineer
О нас
Chess.com — один из крупнейших игровых сайтов в мире и платформа №1 для игры, обучения и удовольствия от шахмат.
Мы — команда из более чем 600 полностью удаленных сотрудников из более чем 60 стран, которые усердно работают, чтобы служить мировому шахматному сообществу. Мы здесь, чтобы поддерживать более 250 миллионов шахматистов по всему миру, предоставляя им лучший возможный продукт, контент и инструменты для обслуживания сообщества!
Мы — технологическая компания. Игровая компания. Контентная компания. И мы делаем все это со страстью и приверженностью игре. Прежде всего, мы ценим нашу миссию, плоскую, жизнеутверждающую, некорпоративную культуру, и мы с нетерпением ждем встречи с вами и узнаем больше о том, что вы можете привнести в команду.
О роли
Инженер по надежности сайта (SRE) будет играть ключевую роль в обеспечении стабильности, производительности и масштабируемости глобальной инфраструктуры нашей игровой платформы. Эта должность существует для преодоления разрыва между разработкой и эксплуатацией, поддержания высокой доступности для миллионов одновременных пользователей при поддержке быстрой разработки и развертывания функций. SRE будет играть важную роль в создании отказоустойчивых систем, способных справляться с огромными нагрузками в нескольких регионах, напрямую влияя на пользовательский опыт и надежность платформы.
Поскольку наша платформа продолжает расти и обслуживать глобальное сообщество, эта роль будет определять технические решения в области инфраструктуры, которые обеспечивают бесперебойную игру. Эта должность требует как глубоких технических знаний, так и лидерских качеств для совместной работы с инженерными командами, обеспечивая эффективную масштабируемость наших систем при сохранении стандартов производительности, которых ожидают наши пользователи.
Что вы будете делать
- Разрабатывать и внедрять многорегиональную отказоустойчивую инфраструктуру, способную обрабатывать миллионы одновременных сессий и транзакций ежедневно в глобальных центрах обработки данных
- Руководить стратегией миграции гибридного облака, интегрируя ресурсы локальных дата-центров с облачными сервисами для оптимальной производительности и экономической эффективности
- Отвечать за ротацию дежурств и процедуры реагирования на инциденты, обеспечивая быстрое устранение критических системных проблем и поддержание SLA высокой доступности
- Архитектурно проектировать системы мониторинга и оповещения с использованием стандартных отраслевых инструментов для проактивного выявления и устранения узких мест в производительности до того, как они повлияют на пользователей
- Сотрудничать с командами разработки для внедрения практик Infrastructure-as-Code и настройки конвейеров развертывания, поддерживающих непрерывную интеграцию и доставку
- Оптимизировать производительность системы посредством планирования мощностей, нагрузочного тестирования и распределения ресурсов в распределенных вычислительных средах
- Устанавливать и поддерживать протоколы безопасности и процедуры оценки рисков для компонентов инфраструктуры и защиты данных
- Взаимодействовать с инженерными командами для проектирования масштабируемых решений для высоконагруженных приложений и требований к обработке в реальном времени
- Продвигать инициативы по автоматизации для снижения ручной операционной нагрузки и повышения надежности системы за счет скриптования и управления конфигурацией
- Наставлять членов команды по лучшим практикам SRE и вносить вклад в разработку стандартов инфраструктуры и документации
Предпочтительные навыки
- Степень бакалавра в области компьютерных наук, инженерии или смежной технической области, или эквивалентный практический опыт
- 5+ лет опыта работы в сфере SRE, DevOps или инженерной инфраструктуры
- Опыт управления инфраструктурой физических серверов и эксплуатации дата-центров
- Высокое владение операционными системами UNIX/Linux и администрированием командной строки
- Опыт работы с облачными платформами (GCP, AWS или Azure) и инструментами Infrastructure-as-Code (Terraform, CloudFormation или аналогичными)
- Практический опыт работы с системами управления конфигурацией (Ansible, Chef, Puppet или аналогичными)
- Глубокое понимание основ сетей, протоколов (TCP/IP, HTTP/HTTPS, DNS) и устранения неполадок в сети
- Опыт работы с технологиями контейнеризации и оркестрации (Docker, Kubernetes или аналогичными)
- Владение инструментами мониторинга и наблюдаемости (Datadog, Prometheus, Grafana, ELK stack или аналогичными)
- Опыт работы с реляционными базами данных и NoSQL, включая оптимизацию производительности и стратегии масштабирования
- Отличные навыки сотрудничества и коммуникации для эффективной работы в распределенной команде
- Демонстрируемое чувство ответственности и подотчетности за надежность и производительность системы
Желательно
- Продвинутые знания сетей доставки контента (CDN) и граничных вычислений
- Опыт работы с серверной автоматизацией и скриптовыми языками (Python, Go, Bash или аналогичными)
- Опыт работы с высокодоступными архитектурами и планированием аварийного восстановления
- Знание фреймворков безопасности и требований соответствия
- Опыт работы с инфраструктурой игровых серверов или хостингом приложений реального времени
- Знание администрирования и оптимизации баз данных для высококонкурентных приложений
- Понимание конвейеров CI/CD и автоматизации развертывания
- Опыт работы с инструментами планирования мощностей и тестирования производительности
- Предыдущий опыт работы в полностью удаленной, распределенной рабочей среде
- Стремление к непрерывному обучению с интересом к новым инфраструктурным технологиям
О возможности
- Это полная занятость
- Мы на 100% удаленные (работайте откуда угодно!)