Финтех-стартап, процессинг платежей 2025

GPU-кластер для ML-инференса

Kubernetes + NVIDIA A100: авто-скейлинг ML-моделей, стоимость инфраструктуры −35% при росте нагрузки ×3.

−35%
стоимость инфраструктуры
×3
рост нагрузки
78%
GPU-утилизация
10 мин
деплой моделей

Задача

ML-модели для фрод-мониторинга работали на 4 GPU-серверах вручную. Пиковая нагрузка в вечерние часы не влезала, днём GPU простаивали на 30%. Затраты на инфраструктуру росли быстрее выручки. Нужно было автоматизировать и масштабировать.

Решение

Подняли GPU-кластер на Kubernetes: NVIDIA A100, autoscaler по метрикам GPU-утилизации, очереди через Triton Inference Server. Модели загружаются динамически, реплики масштабируются 0→N за 30 секунд. Мониторинг стоимости по командам, бюджетные лимиты и алерты в Slack.

Результат

Стоимость инфраструктуры −35% при росте нагрузки ×3 за квартал. Время деплоя новых моделей: с 4 часов до 10 минут. GPU-утилизация с 30% до 78%. Zero downtime — модели обновляются без обрыва трафика через canary-релизы.

Подробности

Стек: Kubernetes, NVIDIA A100, Triton Inference Server, Prometheus, Grafana. Авто-скейлинг 0→32 GPU-реплик, canary-деплой, A/B-тестирование моделей, бюджетные алерты. Обработка 50 тыс. транзакций/мин.

Обсудим ваш проект?

Расскажите задачу — предложим решение в течение рабочего дня.

hello@kremen-lab.ru