Dwelly — Старший аналитик (AI-агенты)
Диджитализируем и оптимизируем аренду квартир в UK. Через классный продукт и оптимальные бизнес-процессы поднимаем маржинальность бизнеса агентств недвижимости со средних 10% до 40%.
Эта роль подразумевает исследование, оценку и улучшение нашего основного продукта: автономных AI-агентов, через которых проходят все процессы управления недвижимостью, от взимания платежей с арендаторов до решения их проблем с водопроводными кранами. Агенты сами общаются с арендаторами, лендлордами и поставщиками, принимают решения в рамках своих полномочий и зовут человека только тогда, когда без него действительно не обойтись.
Пример одного процесса, который ведёт агент
- За месяц до окончания срока действия сертификата электрической безопасности агент сам запускает процесс инспекции и обновления сертификата.
- Рассылает запросы на инспекцию по конкретному адресу нескольким поставщикам и собирает котировки от тех, кто готов.
- Выбирает лучшего поставщика и передаёт ему контакт арендатора, чтобы тот договорился о дате визита.
- Держит статус под контролем: получает от поставщика подтверждение и дату визита.
- В дату визита проверяет, что поставщик прислал результаты инспекции. Если нет, напоминает.
- Если по результатам есть замечания, требующие ремонта, котирует стоимость ремонта у нескольких поставщиков.
- Согласует лучшего поставщика и стоимость с лендлордом.
- Отдаёт контакт арендатора поставщику.
- В конце выставляет и оплачивает все счета во все стороны и обновляет данные о сертификате.
Раньше всем этим занимались люди. Агент ничего не забывает и действует моментально, как только получает нужную информацию. Это не только повышает эффективность человеческого труда, но и существенно улучшает качество сервиса для арендатора. Но у автономности есть обратная сторона: агент может ошибиться уверенно и молча. Поэтому главный вопрос для аналитики у нас такой: как понять, что агент работает хорошо, и как сделать так, чтобы он работал лучше.
Зачем тут аналитика
- Как понять, что новая версия агента (промпт, модель, инструменты) лучше старой, до того как она пойдёт в прод? Какие оффлайн-метрики приёмки использовать? Сколько кейсов нужно в эвал-сете, чтобы разница между версиями не оказалась шумом?
- Как собрать эвал-сет, который отражает реальность, а не только happy path? Где взять редкие, но дорогие кейсы: протечку в пятницу вечером, арендатора, который перестал отвечать, лендлорда, который не согласен со сметой?
- Можно ли прогнать агента через симуляцию, где арендатор, лендлорд и поставщик тоже LLM? Насколько сценарии симуляции покрывают реальное распределение кейсов? И предсказывает ли результат в симуляции то, что будет в проде?
- Можно ли доверять LLM-as-a-judge? Насколько его оценки совпадают с человеческой разметкой, в чём он систематически ошибается и как это измерить?
- Когда агент зовёт человека на помощь, насколько это оправдано? А сколько было случаев, когда звать было нужно, а он не позвал? Сколько времени уходит на реакцию живого человека? Можно ли улучшить агента, чтобы он справлялся сам?
- Какие ошибки агента самые частые и какие самые дорогие? Что чинить первым: промпт, инструменты, данные или сам процесс?
- Как понимать воронки всех коммуникаций (со всех сторон) и тайминги всех процессов, чтобы улучшать качество сервиса?
- Что такое качество поставщика? Время, уходящее на бронирование визита? Время до даты визита? А что если поставщик реагирует на имейл за минуты, но планирует ремонт только через 6 дней? А что если срок такой большой по инициативе арендатора (он не смог раньше), а не поставщика? На какой сигнал нужно посмотреть, чтобы это понять?
- Как действовать, если клиент звонит по телефону и нужно вмешаться в автономный флоу?
- Сколько теперь нужно сотрудников, чтобы справляться с прежним объёмом работы? И как рост автономности агентов переводится в маржу?
- Нужно ли включать выходные в расчёт таймингов по задачам? А нерабочее время в целом?
- Точно ли агенты покрывают все сценарии управления недвижимостью? И что координаторы делают вне системы, общаясь по телефону?
Почему прикольно
- Крутые фаундеры, у которых есть чему поучиться.
- Большой, но компактный и хорошо капитализируемый рынок.
- Одна из немногих задач, где автономные агенты делают реальную операционную работу в проде, а качество их работы напрямую видно в деньгах.
- Международный опыт, покачаете британский английский.
- Мы нанимаем только синьоров (ваши коллеги будут такими же).
Требования
- Ищу мастера на все руки с уровнем «Старший аналитик».
- Уверенная прикладная статистика и дизайн экспериментов: доверительные интервалы, мощность, сравнение версий на маленьких выборках.
- Понимание того, как ломаются LLM-системы, и желание глубоко разбираться в оценке агентов. Опыт с эвалами, LLM-as-a-judge или симуляциями будет большим плюсом.
- Удалёнка не из РФ/РБ.
- Английский, который позволяет вести рабочую коммуникацию.
Условия
- Платим рыночно в фунтах/долларах/евро (вы должны уметь принимать платежи в валюте).
- Ремоут, часовой пояс +/- Лондон
- Для успешных кандидатов можем сделать рабочую визу в UK или какую-то страну ЕС через Deel