Инженер по машинному обучению, TTS
Команда: Исследования
Местоположение: Европа
Тип занятости: Полный рабочий день
О Cantina
Cantina — это новая социальная платформа, основанная Шоном Паркером, с самым продвинутым в мире ИИ-генератором персонажей. Наши боты — это реалистичные, социальные существа, которые могут взаимодействовать везде, где люди находятся онлайн — в голосовом, видео- и текстовом формате. Создайте себя, вообразите кого-то нового или выберите из тысяч персонажей, чтобы делиться бесконечно масштабируемым, персонализированным контентом и бесшовным групповым чатом.
Если вас волнует, как ИИ может формировать творчество и социальное взаимодействие, присоединяйтесь к нам, чтобы создавать будущее.
О роли:
Мы ищем инженера-исследователя / ML-инженера в нашу команду по работе с речью, чтобы создавать передовые системы TTS — от спецификаций данных до продакшн-инференса. Вы будете управлять циклом «модель ↔ данные ↔ оценка» для TTS и смежных задач (клонирование голоса, управляемый TTS, преобразование голоса и многое другое), тесно сотрудничая с исследователями, специалистами по данным и инфраструктурой для быстрого выпуска надежных и экономически эффективных моделей. В этой роли вы будете работать на стыке передовых исследований и практической инженерии, внося вклад в разработку безопасных, управляемых и надежных ИИ-систем.
Что вы будете делать:
- Создание моделей: Архитектура, реализация, предварительное обучение, тонкая настройка и постобучение/выравнивание (например, GRPO/DPO) для крупномасштабных моделей речи.
- Лидерство в проектах: Самостоятельное руководство небольшими исследовательскими проектами при сотрудничестве в более крупных командных инициативах.
- Дизайн экспериментов: Разработка, проведение и анализ научных экспериментов для углубления нашего понимания моделей.
- Разработка инструментов: Разработка и улучшение инструментов разработки для повышения производительности команды.
- Полноценный вклад: Вклад во весь стек, от низкоуровневых оптимизаций до высокоуровневого дизайна моделей.
- Владение данными: Определение требований к данным и сотрудничество в области их приобретения, курирования, дополнения, контроля качества маркировки и стратегий синтетических данных.
- Строгая оценка: Разработка автоматизированных объективных/субъективных оценок — прослушивание, метрики на основе SV/WER/ASR, проверки робастности и предвзятости, а также исследования по тестированию на проникновение (red-teaming).
- Доставка пайплайнов: Укрепление пайплайна обучения → оценка → инференс; профилирование задержки, памяти и стоимости; и соответствие SLA продакшна с помощью надежного мониторинга и отката.
- Масштабирование GPU: Сотрудничество с инфраструктурным отделом для распределенного обучения/инференса на облачных кластерах и продакшн-развертывание моделей с обеспечением надежности и наблюдаемости.
- Безопасность и ответственность: Вклад в механизмы безопасности/согласия и в смягчение последствий злоупотреблений для ответственных речевых технологий.
Что вы принесете:
- Исключительный опыт исследований/разработки с крупномасштабными аудиомоделями (модели >3 млрд параметров и >500 тыс. часов данных).
- Исключительное понимание и практический опыт работы с архитектурами трансформеров и/или диффузионными моделями (включая дистилляцию и потоковую передачу) и/или моделями аудиоязыкового моделирования.
- Богатый опыт распределенного обучения моделей на нескольких узлах и нескольких GPU.
- Сильные навыки программной инженерии с подтвержденным опытом создания сложных систем.
- Отличное владение PyTorch и опыт работы с производительностью (профилирование, CUDA/Triton/C++ по мере необходимости) и написание надежного кода продакшн-качества.
- Опыт вывода крупномасштабных речевых/аудиомоделей в продакшн.
- Опыт работы с крупномасштабными ML-данными.
- Способность итерировать над данными и триангулировать качество, используя субъективные и объективные сигналы.
- Значительные публикации и/или вклад в open source в области речи/аудио/ML.
- Опыт работы с клонированием голоса, управлением речью, генерацией голоса.
Предпочтительный опыт:
- Опыт вывода крупномасштабных речевых/аудиомоделей (TTS/VC/ASR) в продакшн.
- Опыт работы с крупномасштабными ML-системами.
- Опыт работы с моделями аудиоязыкового моделирования, архитектурами трансформеров.
- Опыт работы с клонированием голоса, управлением речью, генерацией голоса.
- Опыт обработки крупномасштабных ML-данных.
- Публикации или заметный вклад в open source в области речи/аудио/ML.
Компенсация:
Ожидаемый диапазон годовой базовой заработной платы для этой должности составляет от 200 000 до 220 000 долларов США (170 000–190 000 евро). При определении компенсации будут учитываться различные факторы, включая навыки, опыт, объем работы, местоположение и данные о конкурентоспособности на рынке труда.
Льготы для должностей в США:
- Конкурентоспособная заработная плата и щедрые опционы компании.
- Медицинская, стоматологическая и офтальмологическая страховка — 99,99% страховых взносов покрываются Cantina.
- 42 дня оплачиваемого отпуска, включая:
- 15 дней PTO
- 10 дней больничного
- 15 официальных праздников
- 2 плавающих выходных дня
- Щедрый отпуск по уходу за ребенком и поддержка фертильности.
- Пенсионный сберегательный план 401(k).
- Счет расходов на образ жизни — 500 долларов США в месяц, которые можно использовать по своему усмотрению.
- Бесплатные обеды и закуски для сотрудников, работающих в офисе.
- Членство в One Medical и многое другое!