Title: Senior Site Reliability Engineer
Location: Remote
Department: Engineering
О чем вы будете заботиться
Garner стремится трансформировать систему здравоохранения США — и мы единственный проверенный игрок, который именно этим и занимается. Мы сотрудничаем с работодателями, чтобы переосмыслить работу здравоохранения: применяем 550+ запатентованных клинических метрик по 80+ специальностям к набору данных из 320M+ пациентов, чтобы выявить лучших врачей, а затем используем убедительные стимулы для направления участников к лечению, которое помогает им быстрее поправиться.
Результат — редкая взаимовыгодная ситуация: лучшее лечение и снижение затрат как для участников, так и для работодателей. Всего за пять лет наша работа помогла более чем 2,5 миллионам человек получить доступ к более качественному лечению и сэкономила 1 миллиард долларов на расходах на здравоохранение. Недавно мы привлекли финансирование серии E и росли вдвое в течение пяти лет подряд. Если вы когда-либо хотели, чтобы ваша работа решала проблему, которая затрагивает каждого человека в этой стране, это возможность сделать именно это. Вы присоединитесь к команде, которая фундаментально переосмысливает здравоохранение в США — и использует ИИ, чтобы масштабировать это влияние дальше и быстрее, чем кто-либо другой.
О роли:
Мы ищем старшего инженера по надежности сайтов (Senior Site Reliability Engineer), который будет отвечать за надежность, производительность и отказоустойчивость облачной инфраструктуры, обеспечивающей продукты Garner и рабочие нагрузки ИИ/МО. Эта роль входит в нашу команду Platform Engineering. Вы будете управлять машиной: определять и поддерживать SLO, руководить реагированием на инциденты и продвигать автоматизацию и стандарты, которые позволят каждому инженеру Garner быстрее и надежнее выпускать код. Поскольку наши системы напрямую влияют на результаты лечения миллионов пациентов, поддержание высочайших стандартов качества производства имеет первостепенное значение. Это роль с фокусом на автоматизацию: вы будете использовать инструменты ИИ для постоянного преобразования ручной операционной работы в контролируемые, автономные процессы, поэтому роль будет становиться более эффективной по мере вашего развития.
Где вы будете работать:
Штаб-квартира Garner находится в Нью-Йорке, но эта должность доступна для людей, которым комфортно работать удаленно и которые готовы к периодическим командировкам в штаб-квартиру.
Что вы будете делать:
- Управлять машиной: Отвечать за комплексную надежность, производительность и отказоустойчивость облачных сред Garner (AWS, Kubernetes), включая те, которые обеспечивают рабочие нагрузки ИИ/МО; определять, измерять и поддерживать SLO для наших критически важных сервисов.
- Руководить реагированием на инциденты: Участвовать в дежурстве по вызову, руководить реагированием на инциденты и проводить глубокий анализ первопричин, доводя корректирующие действия до завершения и тщательно проверяя изменения инфраструктуры.
- Отвечать за наблюдаемость (Observability): Создавать и поддерживать системы мониторинга, оповещения и наблюдаемости, которые позволяют нам обнаруживать и устранять проблемы до того, как они затронут пользователей.
- Масштабировать и оптимизировать: Преобразовывать неоднозначные требования к высокопроизводительному масштабированию в четко определенные, автоматизированные и компонуемые результаты инфраструктуры как кода (Terraform); проактивно выявлять и внедрять меры по повышению рентабельности и производительности во всем стеке для максимизации рентабельности облачных инвестиций.
- Автоматизировать рутинную работу: Уменьшать технологический долг и снижать операционные издержки, используя инструменты ИИ и автоматизацию для преобразования повторяющейся операционной работы в автономные, контролируемые процессы, и применяя к нашей внутренней платформе те же строгие стандарты, что и к продуктам, ориентированным на клиента.
- Помогать инженерам: Создавать и поддерживать стандарты развертывания и наблюдаемости, которые позволяют более широкой команде инженеров быстрее и надежнее выпускать функции ИИ; четко доносить сложные концепции облака и надежности до технических и нетехнических заинтересованных сторон.
- Обеспечивать безопасность и соответствие требованиям: Гарантировать, что наша инфраструктура и операции соответствуют обязательствам Garner по безопасности и соответствию HIPAA.
Идеальный кандидат имеет:
- Более 4 лет практического опыта эксплуатации облачной инфраструктуры в производственной среде в больших масштабах в роли SRE, DevOps или Platform Engineering.
- Глубокие знания Kubernetes и Terraform в облачной среде (предпочтительно AWS).
- Богатый опыт в области производственной наблюдаемости: определение SLO, создание систем мониторинга и оповещения, а также руководство реагированием на инциденты и проведение разборов инцидентов без обвинений (blameless post-incident reviews).
- Прочные основы разработки программного обеспечения на Python или Go, применяемые к автоматизации инфраструктуры (опыт работы с API Kubernetes приветствуется).
- Опыт в обеспечении рентабельности и оптимизации производительности облачных ресурсов (вычислительные мощности, хранилища, сети).
- Опыт поддержки рабочих нагрузок ИИ/МО или интенсивных данных в производственной среде приветствуется.
- Опыт работы в среде с повышенными требованиями к безопасности или регулируемой среде (HIPAA, SOC 2) приветствуется.
- Свободное владение инструментами ИИ (например, Claude), применяемыми в реальных инженерных и операционных рабочих процессах, или сильная мотивация быстро освоить их.
- Желание быть частью высокопроизводительной, целеустремленной команды, которая действует с высокой степенью срочности, сильным чувством индивидуальной ответственности и приверженностью к честной обратной связи.
Технологии, которые мы используем:
- AWS, Kubernetes, Terraform, Istio, Python, Go, TypeScript, Postgres, NATS, Datadog, GitLab
Прозрачность компенсации:
Ценовой диапазон для этой должности составляет $191 000–$226 000. Индивидуальная компенсация будет зависеть от различных факторов, включая квалификацию, навыки и применимые законы. В дополнение к базовой компенсации эта роль дает право на участие в нашей программе опционов на акции и конкурентных планах льгот, включая, но не ограничиваясь: гибкий PTO, варианты планов медицинского, стоматологического и офтальмологического страхования, 401(k) с корпоративным соответствием, гибкие сберегательные счета, Teladoc Health и многое другое.