⌘ Обзор роли
Data Scientist — это первая вакансия в команде, чья задача — внедрять машинное обучение в продакшн, а не просто в ноутбук. Вы будете создавать модели, которые работают в продукте и других потоках в реальном времени, а не просто предоставляют отчеты в дашборде спустя неделю.
Первый флагманский проект посвящен персонализации на протяжении всего пути пользователя: модель, которая определяет, какое предложение показать каждому пользователю, интегрированное непосредственно в продукт и жизненный цикл, а не хранящееся в таблице склада данных. После этого вы распространите ту же схему: модель → API → продукт на другие высокоэффективные моменты в пути пользователя.
Вы будете тесно сотрудничать с Product, Engineering и Lifecycle marketing, чтобы внедрять модели как функции, а не как отчеты. Это также основополагающая роль для инфраструктуры команды: большая часть того, что сегодня делает Data, — это пакетная обработка (dbt, Lightdash, BigQuery); вы поможете создать наши первые шаблоны обслуживания в реальном времени с низкой задержкой на GCP и будете тесно сотрудничать с инженерами над этим.
⌘ Ключевые обязанности
1. Разработка ML в продакшне
- Создание, валидация и внедрение ML-моделей (пропагандистские модели, оптимизация ценообразования/скидок, персонализация, отток/LTV), которые запускаются в продакшн, а не просто являются прототипами в ноутбуках.
- Полный жизненный цикл: постановка задачи, инжиниринг признаков, обучение, оценка, развертывание, мониторинг, переобучение.
- Написание кода продакшн-качества (протестированного, версионированного, проверенного) — вы будете работать вместе с инженерами, к вам будут предъявляться те же требования.
2. Персонализация на протяжении всего пути: от paywall до жизненного цикла
- Разработка и внедрение модели персонализированных скидок: кому, какое предложение и почему, предоставляемое в момент принятия решения о paywall.
- Партнерство с продуктовой командой в разработке ML-экспериментов (A/B-тестирование, holdouts) для доказательства причинного влияния моделей, а не только корреляции.
- Создание системы измерения, чтобы решения о ценообразовании/скидках были обоснованы перед финансовым отделом и руководством.
3. ML-инфраструктура и MLOps (GCP)
- Создание нашего первого шаблона обслуживания моделей с низкой задержкой на GCP (например, Vertex AI endpoints, Cloud Run или эквивалент).
- Определение шаблона конвейера признаков: что предварительно вычисляется в BigQuery/dbt, а что требует свежих данных в реальном времени через Pub/Sub или аналогичные сервисы.
- Настройка мониторинга моделей: дрейф, устаревание, качество предсказаний, чтобы живая модель не деградировала незаметно.
4. Партнерство с продуктовой командой и инженерами
- Тесное взаимодействие с продуктовой командой и инженерами, а не только с Data; эта роль оценивается по тому, что внедряется для реальных пользователей, а не только по ноутбукам.
- Преобразование продуктовой задачи («как мы можем реактивировать отставших плательщиков») в задачу моделирования, а выход модели — в API-контракт, с которым могут работать инженеры.
- Четкая документация передач, чтобы инженеры могли долгосрочно владеть слоем обслуживания без вашего участия в качестве узкого места.
5. Экспериментация и причинно-следственный анализ
- Разработка моделей влияния/причинности, где «кто реагирует на скидку» важнее, чем «кто отваливается».
- Проведение и интерпретация экспериментов, изолирующих фактическое инкрементальное влияние модели на выручку/удержание.
- Разработка программы экспериментов для улучшения моделей анализа данных и машинного обучения с той же строгостью, которую мы применяем в наших текущих программах экспериментов.
⌘ Ожидаемые результаты
- Модель персонализированных скидок, запущенная в продакшн, принимающая реальные решения о paywall для реальных пользователей: внедренная end-to-end, а не прототип, находящийся на стадии staging.
- Документированный, повторно используемый шаблон обслуживания с низкой задержкой, установленный на GCP (Vertex AI endpoints или Cloud Run) — следующая модель не потребует переделки с нуля.
- Доказанное инкрементальное влияние на ключевой бизнес-показатель (конверсия paywall, эффективность маржи скидок или реактивация отставших плательщиков — выберите тот, который вы хотите видеть в качестве флагманского KPI), продемонстрированное с помощью контролируемого эксперимента, а не просто сравнения «до/после».
- Настроенный мониторинг моделей — оповещения о дрейфе и устаревании означают, что команда узнает об ухудшении живой модели в течение дней, а не месяцев.
- Повторяемый плейбук «модель в продакшн», которому могут следовать другие члены команды.
⌘ Навыки и компетенции
Обязательно (hard skills)
- Отличное знание Python для науки о данных и ML (scikit-learn, XGBoost/LightGBM; PyTorch или TensorFlow как плюс, если глубокое обучение актуально для будущих кейсов).
- Подтвержденный опыт внедрения моделей в продакшн, а не просто моделирования в ноутбуке. Умение рассказать как минимум об одной модели, обслуживавшей трафик в реальном времени.
- Практический опыт работы с облачной ML-платформой, желательно GCP (Vertex AI, BigQuery ML, Cloud Run/Functions) или быстрая способность применить эквивалентный опыт AWS/Azure.
- Уверенное знание SQL; комфортная работа с dbt/BigQuery warehouse.
- Основы программной инженерии: git, code review, тестирование, CI/CD: Вы будете выпускать код, которому инженеры должны доверять.
- Опыт в причинно-следственном анализе / uplift-моделировании или прикладной экспериментации: ценообразование и скидки требуют понимания «что, если бы мы не сделали», а не просто «кто отваливается».
Желательно
- Опыт работы с потоковыми/событийными конвейерами (Pub/Sub, Dataflow, Kafka): полезно, поскольку мы отходим от чисто пакетной обработки.
- Опыт работы с ценообразованием, скидками, персонализацией.
- Знакомство с feature stores или DIY-эквивалентом (версионированные конвейеры признаков).
- Multi-armed bandits или обучение с подкреплением для ценообразования/персонализации.
- Опыт работы в стартапе: комфортное создание чего-то с нуля, а не присоединение к существующей команде ML-платформы.
Soft skills
- Искренняя заинтересованность в «влияет ли это на метрику», а не только в «насколько точна модель».
- Умение уверенно общаться с инженерами и с бизнесом: говорить на коммерческом языке, а также на языке инженерии.
- Объяснять компромиссы моделирования простыми деловыми терминами для Product/руководства, не упрощая чрезмерно и не используя слишком много жаргона.
- Комфортное принятие неопределенности — эта роль заключается в определении шаблона, а не в следовании ему.
⌘ Требуемый опыт
- 4–7 лет работы в роли Data Scientist / ML Engineer, с как минимум одной моделью, которую вы лично довели от прототипа до продакшна, обслуживающего реальных пользователей или трафик.
- Количественное образование (CS, статистика, инженерия или эквивалентный практический опыт).
- Опыт работы в B2C, подписных сервисах или маркетплейсах — большой плюс.
- Свободное владение английским языком.
⌘ Процесс найма
Вступительный звонок — 30 минут с менеджером по подбору персонала.
Бизнес-интервью — 30 минут с VP Data.
Кейс-стади — асинхронная оценка.
Панельное интервью — ответы на вопросы по кейс-стади.
Финальное интервью — интервью с продакт-менеджером