О Toloka
В Toloka AI мы создаем данные, которые питают ведущие модели GenAI и инновации. Мы работаем с передовыми лабораториями, крупными технологическими компаниями, известными стартапами в области ИИ, предприятиями и некоммерческими исследовательскими организациями по всему миру. Мы используем комбинацию Экспертов + Крауд + Технологическая платформа для обучения ИИ-моделей рассуждению, а также для оценки их эффективности и безопасности. У нас есть эксперты в более чем 50 различных областях — от врачей и юристов до физиков и инженеров — и мы гордимся одним из самых разнообразных глобальных краудов, представляющих более 100 стран и говорящих на 40+ языках. Мы — хорошо финансируемый стартап с завидным портфолио клиентов, включая Anthropic, Amazon, Microsoft, Poolside, Recraft и Shopify.
Недавно мы привлекли стратегические инвестиции под руководством Bezos Expeditions и Nebius Group с участием Михаила Паракхина, технического директора Shopify и члена совета директоров ведущих компаний в области GenAI, который теперь является председателем нашего совета директоров. Наша команда, ориентированная на удаленную работу, распределена по всему миру: США, Великобритания, Нидерланды, Сербия и другие страны.
О Команде
Мы — команда ML в Toloka. Мы создаем ML-продукты, которые обеспечивают работу самой платформы, делая каждый проект на Toloka быстрее, дешевле и надежнее.
Вот несколько примеров того, чем мы владеем:
- LLM QA — основная технология механизма автоматической проверки качества Toloka. Каждая аннотация, проходящая через Self-Service, проверяется LLM-агентом, которого мы разрабатываем, обучаем и эксплуатируем.
- Дистилляция и дообучение моделей — адаптация передовых и open-source моделей к задачам Toloka для достижения нужного качества при нужной стоимости.
- Оценка, бенчмаркинг, моделирование затрат и выбор моделей у различных поставщиков.
Мы владеем всей цепочкой. Одна и та же команда разрабатывает ML-решение, выводит его в продакшн, обеспечивает его круглосуточную работу, анализирует результаты, поступающие из реальных проектов, и использует эту информацию для следующей итерации. Нет разделения между исследованиями, инжинирингом и операциями — всё делаем мы.
О Позиции
Вы будете отвечать за полный стек дообучения, RL и оценки Toloka, соединяя прикладные исследования и продуктовый инжиниринг. На этой должности вы будете руководить совершенно новыми инициативами после обучения (такими как GRPO и моделирование вознаграждений), преобразовывать сложные ML-эксперименты в масштабируемые функции платформы и время от времени публиковать технические статьи о своих находках для сообщества ИИ.
Что вы будете делать
- Управлять полным циклом конвейеров дообучения: подготовка данных, обучение SFT/LoRA, дистилляция из передовых моделей в более мелкие, оценка и передача в продакшн — как в виде самообслуживаемых возможностей платформы, так и в рамках прямого взаимодействия с клиентами.
- Расширять наш стек после обучения за пределы SFT в область RL (методы стиля RFT/GRPO, моделирование вознаграждений, вознаграждения на основе LLM-судьи) и помочь в разработке пользовательского RL-потока на платформе — это совершенно новая область.
- Создавать и калибровать системы оценки: настройки LLM-как-судьи, откалиброванные по человеческим меткам, эталонные наборы данных, регрессионные оценки для оптимизационных прогонов.
- Улучшать направляющего агента платформы: дизайн промптов и инструментов, циклы улучшения на основе оценки, сценарии стресс-тестирования и исправление ошибок.
- Проводить эксперименты для клиентских проектов (например, исследования компромиссов между сжатием промптов и дообучением) и превращать результаты в воспроизводимые функции платформы.
- Тесно сотрудничать с инженерами платформы над интерфейсом SDK/API, чтобы задачи обучения и оценки можно было вызывать из существующего рабочего процесса разработчика.
Кого мы ищем
- 4+ года опыта в ML-инжиниринге или прикладных исследованиях, из них не менее 1–2 лет практического опыта работы с LLM в производственной среде или исследовательских условиях.
- Практический опыт дообучения моделей с открытым весом (LoRA/полное FT), включая кураторство данных и понимание того, когда дообучение является неправильным решением.
- Глубокое понимание оценки LLM: создание систем оценки с нуля, ловушки LLM-как-судьи, калибровка по человеческим суждениям.
- Отличные навыки Python-инжиниринга: вы пишете код, который могут запускать другие, а не только ноутбуки; уверенное владение стеком обучения/инференса (PyTorch, экосистема HF, vLLM или аналогичные).
- Продуктовое мышление: вы часто будете ML-специалистом, наиболее близким к решению клиентской проблемы, поэтому вам нужно понимать, что стоит строить, а не только то, что возможно.
- Умение работать в условиях неопределенности — приоритеты меняются по мере получения информации из пилотных проектов.
- Язык: Свободное владение английским языком (B2 или выше).
Будет плюсом
- Практический опыт применения RL для LLM: пост-обучение в стиле GRPO/PPO, моделирование вознаграждений, конвейеры RLHF/RLAIF.
- Фреймворки оптимизации промптов (DSPy/GEPA или аналогичные) или исследования сжатия промптов (gisting).
- Опыт дистилляции и квантования для оптимизации затрат/задержки.
- Опыт создания агентных систем (использование инструментов, многошаговые рабочие процессы) или внедрения ML-функций в самообслуживаемый продукт.
Что мы можем предложить
- Вы станете частью международной, динамичной среды, которая стимулирует инновации и устанавливает новые стандарты в секторе ИИ и технологий.
- Конкурентоспособный компенсационный пакет, включающий базовую зарплату, бонус и ESOP.
- Оплачиваемый отпуск (PTO) и льготы будут варьироваться в зависимости от местоположения.
- Мы предлагаем полностью удаленную или гибридную модель (если вы находитесь в Нидерландах или Сербии).
- Компенсация IT-оборудования и домашнего офиса.
Работодатель, предоставляющий равные возможности:
Toloka стремится предоставлять равные возможности и способствовать созданию инклюзивной среды. Мы приветствуем заявки от всех квалифицированных лиц и не дискриминируем по признаку расы, религии, цвета кожи, национального происхождения, пола, сексуальной ориентации, гендерной идентичности, возраста, семейного положения, статуса ветерана, инвалидности или любой другой характеристики, защищенной применимым законодательством. Решения о найме принимаются на основе квалификации, заслуг и потребностей бизнеса.
[Важное уведомление] Осторожно: Мошенничество с поддельными вакансиями
Нам стало известно, что отдельные лица или группы мошеннически выдают себя за Toloka, размещая поддельные вакансии и запрашивая личную информацию у соискателей. Пожалуйста, имейте в виду:
- Официальная связь: Наша команда по подбору персонала будет связываться с вами только с официального адреса электронной почты "toloka.ai". Мы НИКОГДА не будем использовать Gmail, Yahoo, Tolokainc, toloka.inc или другие личные или якобы деловые учетные записи электронной почты.
- Наш процесс: Мы НИКОГДА не будем запрашивать данные вашего банковского счета, номер кредитной карты или какие-либо сборы в рамках процесса подачи заявления или собеседования.
- Официальные объявления: Все легитимные вакансии публикуются на нашей официальной странице карьеры.
Что делать: Если вы видите подозрительную вакансию или с вами связался кто-то, кого вы подозреваете в мошенничестве, пожалуйста, не предоставляйте никакой личной информации. Вместо этого сообщите нам об инциденте напрямую по адресу security@toloka.ai и сообщите о профиле/публикации в LinkedIn. Мы относимся к этому вопросу очень серьезно и сотрудничаем с соответствующими сторонами для его решения.
Спасибо за вашу бдительность!
Узнайте, как мы собираем, используем, раскрываем и храним персональные данные, ознакомившись с нашим Уведомлением о конфиденциальности.