Введение:
Оживим крутые технологические идеи! Intellias — это компания с 3000 сотрудников по всему миру, где рождаются эталонные технологические решения. Присоединяйтесь и внесите свой вклад в цифровизацию мира.
Обзор проекта:
Присоединяйтесь к инициативе по созданию трансформационной платформы данных и ИИ, направленной на модернизацию корпоративных возможностей и обеспечение принятия решений в реальном времени. Этот проект предоставляет комплексную дорожную карту, охватывающую ИИ, MLOps, управление данными и масштабируемость платформы, поддерживая переход к операциям, ориентированным на данные, и интеллектуальной автоматизации.
Требования:
- PySpark & Spark SQL: Разворачивание вложенных JSON (explode, structs),
mapInPandas / pandas UDFs, оконные функции для агрегатов скорости и уникальных счетчиков, секционирование и оптимизация производительности
- Databricks: Unity Catalog (каталоги, схемы, разрешения, маски столбцов, теги, происхождение данных), внешние расположения на S3, политики кластеров / вычислений, включая GPU, Auto Loader, Delta (MERGE, time travel, VACUUM), Workflows, Repos, секретные области
- AWS: S3, роли IAM / профили экземпляров, расшифровка KMS в заданиях, Secrets Manager, базовое понимание стоимости
- Инженерия данных для ML: Medallion design (Bronze / Silver / Gold), эволюция схем, идемпотентные загрузки, профилирование DQ, Feature Engineering в UC (таблицы признаков)
- Псевдонимизация в конвейерах: HMAC токенизация с ключами по типу ключа, нормализация (Unicode NFKD, регистр, сортировка токенов), фонетические ключи, никогда не логирование необработанных значений, скриптованное удаление (DROP / VACUUM / уничтожение секретов)
- Разрешение сущностей (реализация): Блокировка / генерация кандидатов с точными и приблизительными ключами, допуск к расстоянию редактирования, оценки совпадений, суррогатные ID, подсчет конфликтов вместо слияния
- Обработка изображений в масштабе: Запуск пакетного задания GPU, которое расшифровывает, обрезает и встраивает изображения в память (PyTorch / timm), PCA, LSH бакетирование
- Кластеризация смешанных данных: Практический опыт:
kmodes (k-prototypes), gower + kmedoids с выборкой, R kamila на Databricks, StepMix (скрытый класс), bootstrap ARI
- Отбор признаков: Взаимная информация, обрезка корреляций, PCA. Может выполнить поиск BPSO / GA с
mealpy
- MLOps & мониторинг: MLflow эксперименты и реестр (псевдонимы), Lakehouse Monitoring (метрики профиля и дрейфа на таблицах Delta), SQL-оповещения, PSI / JS дивергенция
- Передача: Пишет runbooks и документацию уровня README. Оставляет единый сквозной Workflow, который может выполнить кто-то другой
- Приветствуется
- Опыт работы с AssureID / выходными данными JSON для проверки личности.
- Базовое обучение PyOD и PyTorch (для поддержки A по VAE во 2-й неделе).
Обязанности:
- Настройка платформы. Совместно с командой платформы клиента подготовить и настроить среду Databricks в облачной учетной записи клиента: каталог и разрешения, вычислительные ресурсы (включая GPU), секреты, отслеживание экспериментов.
- Безопасная загрузка данных. Создать повторяемый процесс загрузки необработанных выходных данных проверки и изображений документации: парсинг, псевдонимизация, проверки качества данных, обработка схем.
- Масштабируемая инженерия признаков. Реализовать таблицы признаков:
- пакетные задания встраивания изображений;
- точные и приблизительные ключи связи;
- межтранзакционные агрегаты и агрегаты скорости;
- псевдонимизированное разрешение сущностей.
- Поддержка моделирования. Реализовать методы отбора признаков и кластеризации смешанных данных. Выполнить сравнение моделей и тесты стабильности, а также поддержать запуски обучения плотностных моделей.
- Автоматизация. Оркестрировать сквозной конвейер как запланированный, идемпотентный, многократно запускаемый рабочий процесс.
- Мониторинг. Настроить прототип мониторинга качества данных и дрейфа с оповещениями для таблиц признаков и оценок.
- Инженерия конфиденциальности. Внедрить элементы управления доступом, поля происхождения, происхождение данных и процедуру скриптованного удаления. Убедиться, что необработанные персональные данные не достигают аналитического уровня.
- Документация и передача. Написать runbooks и провести живой обзор, чтобы инженеры могли самостоятельно работать со всем.