Антон Алексеев · ML-инфраструктура

Делаю так, чтобы GPU не простаивали

ML- и inference-платформы на Kubernetes: шеринг GPU, скедулинг, автоскейлинг инференса.

Написать в Telegram

Что я решаю

Запустить модель через docker run можно за вечер. А дальше её надо держать под нагрузкой, делить GPU с другими командами, обновлять без простоя и не спалить бюджет. Вот этим я и занимаюсь.

DAY 0 · ПРОЕКТИРОВАНИЕ

Какое железо и как делить

  • Подбираю инфраструктуру под LLM: память, KV-кэш, точность, модель GPU.
  • Шеринг GPU под тип нагрузки: MIG, MPS, time-slicing, HAMi.
  • Квоты и приоритеты для команд: кто кого может вытеснить.
Шаги в роадмапе →

DAY 1 · ЗАПУСК

Платформа, а не скрипты

  • ML-платформа: команды сами запускают ноутбуки, пайплайны и обучение.
  • Inference-платформа на KServe, Triton и vLLM: модель деплоится без тикета.
  • IaC и GitOps: кластер пересоздаётся одной командой.
Шаги в роадмапе →

DAY 2 · ЭКСПЛУАТАЦИЯ

То, что ломается после запуска

  • Автоскейлинг по очереди и concurrency, а не по CPU: под vLLM процессор спит, пока GPU загружен на 95%.
  • Холодный старт: веса и образы на десятки гигабайт, реплика поднимается минутами.
  • Утилизация и fair share: приоритеты, вытеснение, квоты, чтобы research не съел прод.
  • Наблюдаемость по MIG-слайсам и SLO на TTFT, а не «под живой».
  • Обновляю драйверы, CUDA и модели без даунтайма.
Шаги в роадмапе →

5%Средняя утилизация GPU в продакшен-кластерах Kubernetes по отчёту Cast AI за 2026 год. За простаивающую карту платят как за загруженную.cast.ai ↗

Роадмапы

Журнал

Хабр · AvitoTech

ML для больших компаний: от DevBox до платформы на тысячу пользователей ↗

Как ML-платформа в Авито выросла из DevBox-решений и юнит-платформ разных команд в единую платформу на Kubeflow и с какими проблемами мы столкнулись по пути. Отдельно рассказываю про инференс-платформу и то, как могут выглядеть агентские платформы. Пригодится и тем, кто строит платформы в больших компаниях, и тем, кто работает на DevBox или небольших юнит-платформах.

ML-платформы · Инференс

Дайджест

Дайджест mlinfra · 23.06.2026

Speculative decoding от Modal, prefix caching в GKE Inference Gateway, AI-платформа Databricks и Ray на AKS.

Инференс · ML-платформы

Весь журнал →

Выступления

Подкаст

Карьерное развитие в MLOps (с Юрием Классеном, руководителем MLOps в Купер)

Подкаст ИТМО × Клуб IT-инфраструктуры

ДискуссияЭксперт

Эксперт: Карьерный митап self × Звук, Москва

Карьерный митап self × Звук, Москва

Все выступления →

Связаться

Проще всего написать в Telegram.

TelegramLinkedIngetMentor

↑↓ выбор · Enter открыть · Esc закрыть