Вместе компании создали программно-аппаратный комплекс (ПАК) на базе высокопроизводительного переиспользуемого ML-кластера. Решение работает на базе «Штурвала» и позволяет enterprise-заказчикам перейти от отдельных ИИ-пилотов к воспроизводимому промышленному контуру машинного обучения.
Ключевая идея комплекса — разделить вычислительные ресурсы и прикладную логику. Сегодня, чтобы запустить новую ML-модель, специалисту нужно получить вычислительные ресурсы, подготовить среду, настроить зависимости, организовать обучение и лишь затем передать ее в эксплуатацию. Каждый такой шаг выполняется вручную и плохо воспроизводится от проекта к проекту.
В правильно построенной Kubernetes-среде этот процесс превращается в автоматизированный конвейер: ML-инженер запускает задачу, а платформа сама выделяет необходимые вычислительные ресурсы, создает среду, запускает обучение и масштабирует вычисления. Именно здесь раскрывается одна из ключевых возможностей Kubernetes — автоматизация ML-пайплайнов с использованием таких технологий, как Kubeflow.
«Мы говорим уже не просто о GPU-кластере, а о ПАКе, способном превратить вычислительную инфраструктуру в промышленную фабрику по созданию и эксплуатации ИИ. Но для этого необходима платформа, которая объединяет вычислительные ресурсы в единую управляемую среду. В нашей архитектуре эту роль берет на себя “Штурвал”», — отметил Роман Новогрудский, заместитель директора департамента по работе с нефтегазовым сектором в «Информзащите».
Архитектура решения выстроена как вертикаль — от аппаратных ресурсов до прикладных сценариев. На нижнем уровне находятся вычисления и инфраструктурные ресурсы предприятия: GPU, CPU, storage и сеть. Над ними — платформа «Штурвал», обеспечивающая единый контур ресурсов, доступов, политик и эксплуатации. Еще выше располагается слой MLOps с инструментами Kubeflow, MLflow и model serving — пайплайны, эксперименты и публикация моделей. Замыкают вертикаль ИИ-сервисы и прикладные сценарии: прогнозы, оптимизация, ассистенты и аналитика.
Вокруг ядра выстроены сквозные корпоративные сервисы: единая аутентификация IAM/SSO, объектное хранилище для данных и артефактов, реестр образов и CI/CD, а также мониторинг и аудит. Главный принцип — ML-инструменты получают инфраструктуру как сервис, а не управляют «железом» напрямую. Таким образом, платформа автоматизирует путь от ручной инфраструктурной работы к воспроизводимому ML-конвейеру.
«Ответственность четко разделена: мы даем инфраструктуру как сервис и единые правила эксплуатации, а интегратор привязывает эту основу к бизнес-контуру заказчика. Такой платформенный подход превращает разрозненную инфраструктуру в управляемый конвейер машинного обучения», — прокомментировал Владимир Утратенко, CPO «Штурвала».
Программно-аппаратный комплекс дает воспроизводимую архитектуру, уже проверенную в промышленной эксплуатации у крупного государственного заказчика: