Должность: Старший инженер платформы IaaS / Kubernetes (глобально удаленно, работайте из любой точки мира)
CloudLinux — глобальная компания, ориентированная на удаленную работу. Мы руководствуемся нашими принципами: поступай правильно, сотрудники прежде всего, удаленная работа прежде всего, и мы поставляем высокообъемную, низкозатратную инфраструктуру Linux и продукты безопасности, которые помогают компаниям повысить эффективность их операций. Каждый человек в нашей команде поддерживает друг друга и делает все возможное, чтобы мы все добились успеха.
Мы ищем Старшего инженера платформы IaaS / Kubernetes, который присоединится к нашему Департаменту инфраструктуры и станет ключевым участником в разработке, внедрении и эксплуатации нашей частной облачной и многопользовательской платформы Kubernetes.
Наша инфраструктура поддерживает более 500 виртуальных машин в нескольких дата-центрах, обслуживая более 20 инженерных команд. Мы находимся в процессе перехода от виртуализационной платформы на базе OpenNebula к многопользовательскому облаку на базе Kubernetes с KubeVirt для оркестрации виртуальных машин, сохраняя при этом надежность и операционное совершенство на протяжении всего перехода.
Вы будете работать вместе с текущим техническим руководителем IaaS и сетевым инженером, и при необходимости должны быть способны самостоятельно владеть и эксплуатировать полный стек IaaS (вычисления, хранилища, сети, bare metal). Это не роль "только Kubernetes" — она требует глубоких общих навыков в области инфраструктуры в сочетании с экспертизой в платформе Kubernetes.
Что вы будете делать
Инженерия платформы Kubernetes (основной фокус — 40%)
- Проектирование, создание и эксплуатация многопользовательской платформы Kubernetes с использованием Cluster API (CAPI) с bare-metal провайдерами (Metal3/Sidero).
- Реализация жесткой многопользовательской архитектуры с использованием vCluster (Loft Labs) или аналогичной технологии, предоставляющей изолированные API-серверы Kubernetes на каждого пользователя.
- Развертывание и управление KubeVirt для оркестрации виртуальных машин в Kubernetes, включая привязку CPU, NUMA awareness и конфигурацию HugePages.
- Внедрение инфраструктуры на основе GitOps с использованием ArgoCD или Flux в качестве единственного источника истины для всех конфигураций кластера.
- Развертывание и управление Policy-as-Code с использованием Kyverno или OPA Gatekeeper для управления доступом, квот ресурсов и политик безопасности.
- Создание возможностей самообслуживания с использованием Crossplane или аналогичных Kubernetes-native инструментов для подготовки инфраструктуры.
Инженерия хранилищ (20%)
- Эксплуатация и оптимизация распределенных кластеров хранения Ceph (в настоящее время 1 PiB необработанных данных, 149 OSD, Quincy 17.2.5).
- Управление развертываниями Rook-Ceph operator в масштабе на современном Kubernetes (v1.28+).
- Внедрение ярусного хранения: Ceph для массового хранения, локальные NVMe для рабочих нагрузок с высоким IOPS, LINSTOR/DRBD или TopoLVM для сверхбыстрого реплицируемого хранения.
- Проектирование и внедрение изоляции ввода-вывода для каждой виртуальной машины / каждого пользователя на общих кластерах Ceph.
- Управление CDI (Containerized Data Importer) для жизненного цикла образов виртуальных машин в средах KubeVirt.
Сети (15%)
- Развертывание и управление overlay-сетями для сетевого взаимодействия подов, микросегментации и шифрования WireGuard/IPsec.
- Внедрение Cluster Mesh для связи pod-to-pod между различными дата-центрами.
- Конфигурирование Multus CNI и SR-IOV для поддержки виртуальных машин с несколькими сетевыми интерфейсами в KubeVirt.
- Работа с физической сетевой инфраструктурой: коммутаторы Juniper (JunOS), BGP (eBGP/iBGP), EVPN/VXLAN, VLAN.
- Поддержка VPN-соединений site-to-site между дата-центрами.
Надежность и эксплуатация (15%)
- Практика SRE: определение и поддержание SLO с бюджетными лимитами ошибок, внедрение проактивного управления мощностями с прогнозированием на 6-12 месяцев.
- Проектирование и проведение экспериментов по хаос-инжинирингу для проверки устойчивости системы.
- Участие в дежурствах по очереди для инфраструктуры IaaS (OpenNebula, Ceph, сети).
- Написание и поддержание руководств пользователя (runbooks), документации по плану восстановления после сбоев (DRP) и анализов постмортем.
- Движение к проактивным улучшениям: выявление рисков надежности, узких мест в производительности и рутинной работы — затем предложение и реализация решений без ожидания инцидентов.
Инфраструктура как код и автоматизация (10%)
- Разработка и поддержка модулей Terraform/OpenTofu для подготовки инфраструктуры в мультиоблачной среде.
- Написание плейбуков Ansible для конфигурации серверов bare metal и управления парком.
- Автоматизация жизненного цикла инфраструктуры: загрузочные PXE образы, подготовка оборудования (Foreman), управление IPMI.
- Внедрение практик FinOps: атрибуция затрат, анализ использования ресурсов, рекомендации по изменению размера инстансов с использованием OpenCost/Kubecost.
Требования
Обязательно
- 5+ лет опыта работы в области инфраструктурной/платформенной инженерии, из них не менее 3 лет эксплуатации производственных кластеров Kubernetes (не просто развертывание приложений на K8s, а создание и управление самой платформой).
- Производственный опыт работы как минимум с 3 из следующих технологий:
- KubeVirt или аналогичная технология VM-on-K8s
- Cluster API (CAPI) для декларативного управления жизненным циклом кластера
- Cilium или Calico (продвинутый CNI с интеграцией eBPF или BGP)
- Rook-Ceph или другие операторы хранения Kubernetes в масштабе (100+ OSD) ○ ArgoCD или Flux для управления инфраструктурой на основе GitOps.
- Глубокие знания Linux: настройка ядра, сетевой стек (iptables/nftables, маршрутизация, bonding, VLAN), операции с файловой системой, устранение проблем с производительностью.
- Опыт работы с распределенными хранилищами Ceph: эксплуатация кластера, жизненный цикл OSD, управление пулами, настройка производительности, устранение проблем с деградировавшими состояниями.
- Инфраструктура как код: Terraform/OpenTofu + Ansible в производственном масштабе.
- Опыт работы с bare-metal инфраструктурой: IPMI/iDRAC, PXE boot, конфигурация RAID, диагностика оборудования, эксплуатация дата-центров.
- Основы сетей: BGP, VLAN, IPSec/WireGuard, DNS, балансировка нагрузки.
- Свободное владение письменным и устным английским языком (минимум B2+) — документация, постмортемы и межкомандное общение ведутся на английском языке.
- Проактивный подход: подтвержденный опыт выявления проблем до того, как они станут инцидентами, и внедрения улучшений без указаний.
Желательно
- Опыт создания многопользовательских платформ Kubernetes (vCluster, Capsule или пользовательская изоляция пространств имен).
- Crossplane или аналогичная Kubernetes-native абстракция инфраструктуры.
- Policy-as-Code: Kyverno, OPA Gatekeeper или Kubewarden.
- Безопасность контейнеров: подпись образов (Sigstore/cosign), безопасность во время выполнения (Falco), песочницы выполнения (Kata Containers, gVisor).
- Практики SRE: проектирование SLO/SLI, политики бюджетных лимитов ошибок, хаос-инжиниринг (LitmusChaos, Chaos Mesh), фреймворки управления инцидентами.
- FinOps: OpenCost, Kubecost, оптимизация затрат в облаке.
- Опыт работы с неизменяемыми ОС: Talos Linux, Flatcar Container Linux или аналогичные.
- Опыт работы с OpenNebula (мы мигрируем ОТ нее, поэтому понимание ускорит переход).
- Опыт работы с LINSTOR/DRBD или TopoLVM для высокопроизводительных локальных хранилищ.
- Опыт работы с SR-IOV и DPDK для аппаратного ускорения сетей.
- Опыт миграции от традиционной виртуализации (VMware, OpenNebula, Proxmox) к Kubernetes/KubeVirt.
- Стек Grafana LGTM (Mimir, Loki, Tempo) для наблюдаемости.
- Опыт работы в комплаенс-среде (SOC2, ISO 27001, NIS2).
- Программирование на Go или Python для инфраструктурных инструментов.
- Опыт конфигурирования коммутаторов Juniper JunOS.
Преимущества
Что вас ждет?
- Фокус на профессиональном развитии.
- Интересные и сложные проекты.
- Полностью удаленная работа с гибким графиком, который позволяет вам планировать свой день и работать из любой точки мира.
- Оплачиваемые 24 дня отпуска в год, 10 дней национальных праздников и неограниченные дни больничного.
- Компенсация частного медицинского страхования.
- Компенсация коворкинга и тренажерного зала/спорта.
- Бюджет на обучение.
- Возможность получить вознаграждение за самую инновационную идею, которую компания сможет запатентовать.