ML для больших компаний: статья про ML-платформу на Kubeflow
Вышла текстовая версия доклада с infra.conf 2026 про ML-платформу на Kubeflow. Со ссылками на наши PR в community и манифесты, чтобы воспроизвести платформу у себя.
ML-платформы
Посты из канала «Инфраструктура для AI и ML» и статьи на Хабре.
Вышла текстовая версия доклада с infra.conf 2026 про ML-платформу на Kubeflow. Со ссылками на наши PR в community и манифесты, чтобы воспроизвести платформу у себя.
ML-платформы
Как ML-платформа в Авито выросла из DevBox-решений и юнит-платформ разных команд в единую платформу на Kubeflow и с какими проблемами мы столкнулись по пути. Отдельно рассказываю про инференс-платформу и то, как могут выглядеть агентские платформы. Пригодится и тем, кто строит платформы в больших компаниях, и тем, кто работает на DevBox или небольших юнит-платформах.
ML-платформы · Инференс
Speculative decoding от Modal, prefix caching в GKE Inference Gateway, AI-платформа Databricks и Ray на AKS.
Инференс · ML-платформы
Cloud native становится AI native: DRA, Workload API и Inference Gateway, vLLM в Foundry Local, надёжный LLM-инференс в Databricks и serverless GPU от Modal.
Инференс · LLM и железо
Собрали шеринг GPU между ML-инженерами, похожий на Dev Cluster Яндекса, на ванильном Kubernetes + Kueue в Kubeflow. Разбираю, из каких сущностей он состоит.
Скедулинг и утилизация · Шеринг GPU
Как обещал на докладе, ссылки на наши proposal, PR и issue в Kubeflow Pipelines: central driver, оптимизация recurring runs, метрики и диагностика ошибок подов.
ML-платформы
4 июня на infra.conf рассказываю, как в Авито строим ML-платформу на Kubeflow: очереди на Kueue, патчи пайплайнов, observability, инференс на KServe и свой model registry.
ML-платформы
Ссылки по темам доклада и запись выступления: подходы к MLOps-платформам, профили Kubeflow, Kueue, Istio Sidecar, распределённое обучение и LLM-инференс в KServe.
ML-платформы · Скедулинг и утилизация
Дайджест накануне MLечного пути: апдейты open source serving-проектов, асинхронный инференс через GKE Inference Gateway и DRANET на AKS.
Инференс
Сложность уже не в том, как поднять модель, а в том, как ей управлять в production: DRANET, Inference Gateway и inference operator от AWS.
Инференс
Курс «MLOps для разработки и мониторинга моделей» в Яндекс Практикуме с упором на инфраструктуру: я собирал ядро программы и проектировал инфраструктуру курса.
Карьера и комьюнити
Что уже есть в open source для скедулинга AI-ворклоудов: плагины планировщика с метриками GPU и topology-aware scheduling от NVIDIA.
Скедулинг и утилизация
Запускаю инфраструктурные дайджесты: доставка тяжёлых весов моделей, AI conformance в Kubernetes, мультинодовый инференс на Dynamo и llm-d в CNCF Sandbox.
Инференс · ML-платформы
22 апреля третий раз выступаю на MLечном пути, теперь про платформизацию: путь от DevBox с JupyterLab до централизованной платформы, Kueue, Kubeflow и агентные платформы.
ML-платформы
Почему компании идут в платформизацию, как я делю ML-платформы на уровни Data, ML и Inference. И открытый вопрос: нужна ли она вам прямо сейчас.
ML-платформы
Подвожу итоги года по трекам: доклады и статьи, менторство и курс по MLOps, жизнь канала и немного личного.
Карьера и комьюнити
Записали подкаст с Юрой Классеном из Купера: как перейти в MLOps, как выглядит типичный рабочий день, с какими болями сталкиваешься и какие навыки нужны на рынке.
Карьера и комьюнити
Начинаю серию постов про инференс-платформы с основ: что такое инференс, чем инференс-сервис отличается от веб-сервиса и зачем отделять бизнес-логику от модели.
Инференс
Завтра жду на карьерном митапе сообщества self и Звук: поговорим про карьеру в ML и MLOps, собеседования в бигтех и трек развития.
Карьера и комьюнити
Посты стали реже, но контент есть: исследую инференс-платформы для ML и LLM, хожу на митапы в Москве и пишу вторую часть статьи про подбор инфраструктуры для LLM.
Инференс · LLM и железо
Спасибо, что послушали доклад! Выложил в open source лабораторию для подбора инфраструктуры под LLM и делюсь картинками, которые не попали в презентацию.
LLM и железо
В субботу рассказываю на «Я про бэкенд», как подбираю инфраструктуру для LLM с GenAI Perf. Новое в докладе: автоматизация подбора через Terraform, vLLM production stack и Argo Workflows.
LLM и железо
Все источники к докладу на DevOops в одном сообщении: инференс как веб-сервис, ускорение автоскейлинга, скедулеры для GPU и шеринг видеокарт.
Инференс · Шеринг GPU
После двух месяцев паузы делюсь планами: пишу курс по MLOps, готовлю доклад про аллокацию GPU-ворклоудов в K8S на DevOops и выпустил первую часть статьи про подбор инфраструктуры для LLM.
Карьера и комьюнити · LLM и железо
Первая часть серии о том, как подобрать инфраструктуру под инференс LLM, когда клиент просит «разверните мне Qwen». Разбираемся, из чего складывается требуемая VRAM (параметры модели, активации, KV-кэш, буферы), как подобрать GPU и запустить базовый инференс. Полезно тем, кто впервые прикидывает железо под LLM.
LLM и железо · Инференс
На канале Evrone вышла запись моего доклада про частную инсталляцию Inference-платформы. Хороший повод вспомнить, как устроена платформа.
Инференс
Как тензерирование весов ускоряет загрузку модели в GPU при старте vLLM. Внутри замеры на Qwen3-8B и Qwen3-32B и примеры конфигов.
Инференс
Кеширую веса из HuggingFace в S3 для vLLM. Почему кеш HF не залить как есть и какие есть варианты: rclone, скачивание в локальную папку, тензерирование.
Инференс
Нас 500! По этому поводу видео с кластером DGX B200 и немного статистики канала: посты, доклады, статьи, консультации и подкасты.
Карьера и комьюнити
Материалы к докладу на ODS Data Fest в одном сообщении: инференс на Triton, автоскейлинг и его ускорение, аллокация и шеринг GPU.
Инференс · Шеринг GPU
29 мая веду ODS DataFest в Selectel и рассказываю про узкие горлышки автоскейлинга инференса в k8s, шеринг GPU и скедулеры для ML-нагрузок.
Инференс · Шеринг GPU
Вспоминаем ML-митап Selectel по статье коллеги-организатора. А если нужна текстовая версия моего доклада про подбор инфраструктуры, ставьте реакции.
Карьера и комьюнити
Источники к докладу про подбор инфраструктуры для LLM: оценка VRAM, инференс-фреймворки, конфигурация vLLM и инструменты нагрузочного тестирования.
LLM и железо · Инференс
Потрогал KAI Scheduler, open source планировщик из Run:ai. Разбираю сущности: очереди с квотами, эластичные ворклоуды, приоритеты и шеринг GPU.
Скедулинг и утилизация · Шеринг GPU
Вышла статья-гайд по репозиторию с туториалами по Triton Inference Server: демо платформы, деплой разных форматов моделей и LLM, автоподбор конфигурации и простые UI.
Инференс
Гайд по репозиторию с рецептами для NVIDIA Triton Inference Server: демо Inference-платформы с автоскейлингом и canary-деплоем, запуск моделей разных форматов и популярных LLM, подбор конфигурации через Model Navigator и Model Analyzer. Пригодится тем, кто собирает собственный инференс на Triton в Kubernetes.
Инференс
Так называется мой доклад на ML-митапе Selectel 23 апреля. А по картинке можно угадать, в какой франшизе пойдёт рассказ и что я думаю про TensorRT-LLM.
LLM и железо
MIG, MPS и TimeSlicing не единственные варианты. Смотрю на альтернативы: HAMi с vGPU и dynamic-mig, DRA и шеринг в KAI Scheduler.
Шеринг GPU
23 апреля веду ML-митап Selectel в Петербурге и рассказываю про подбор инфраструктуры для LLM: GPU под инференс, конфигурация vLLM и SGLang, нагрузочное тестирование.
LLM и железо · Инференс
27 марта в Москве рассказываю про автоскейлинг инференса в K8S: scale to zero и scale from zero, кеширование образов и ускорение пуллинга.
Инференс
NVIDIA выпустили open source Dynamo для инференса LLM на нескольких GPU с бэкендами vLLM, SGLang, TensorRT-LLM и mistral.rs. Сам пока не тестировал, но бенчмарки обещаю.
Инференс
Гайдлайн с консультации: как задеплоить инференс на виртуалке с GPU: от архитектур NVIDIA, драйверов и CUDA до Docker-образов и выбора инференс-сервера.
Инференс · LLM и железо
Вышел выпуск подкаста «Сегодня на ретро» с моим участием: поговорили про личный бренд, пользу выступлений для работы и стоит ли компаниям вкладываться в разработчиков-спикеров.
Карьера и комьюнити
Рынок сам не понимает, кто такой MLOps. Объясняю на диаграмме: три сущности (Data, ML и Inference), вертикали специалистов и горизонтальный пайплайн доставки ценности.
Карьера и комьюнити · ML-платформы
Нашёл свою сферу (инфраструктура для ML), поэтому снова переименовываю канал. Делюсь планами исследований на год и тем, с какими вопросами можно ко мне прийти.
Карьера и комьюнити
Вспоминаю выступления 2024 года, от DevOps Conf и ML-митапа до PyCon, TechDay и HighLoad++, и делюсь планами на следующий год.
Карьера и комьюнити
Выложили записи HighLoad++: мой рассказ про Inference-платформу теперь можно посмотреть вместе с презентацией и ответами на вопросы.
Инференс
Завершаю год второй частью на Хабре: как мы реализовали автоскейлинг, canary-деплой, инференс-граф и автоматический подбор конфигурации Triton.
Инференс
Вторая часть про Inference-платформу Selectel: пять фич поверх стандартного Triton в Kubernetes. Это canary-деплой, автоскейлинг с ускорением пуллинга образов, инференс-граф, оптимизация Triton и UI без разработчиков. Для тех, кому мало просто задеплоить Helm chart с Triton.
Инференс
Нашёл калькулятор, который считает, сколько памяти GPU нужно LLM для обучения или инференса, причём и для готовых моделей, и по вашим параметрам.
LLM и железо
Первая часть по мотивам доклада на HighLoad: требования к платформе, почему начинали с Seldon и отказались от него и как платформа выглядит сейчас.
Инференс
Первая часть рассказа об Inference-платформе Selectel: какие требования мы к ней предъявляли, почему начинали с Seldon Core и в итоге пришли к NVIDIA Triton, как устроены инфраструктура платформы и её доставка клиенту. Полезно тем, кто выбирает, на чём строить свой инференс.
Инференс · ML-платформы
Источники к докладу на HighLoad в одном сообщении: Istio и canary-деплой, автоскейлинг, ускорение пуллинга образов, шеринг GPU и не только.
Инференс · Шеринг GPU
Рассказываю на HighLoad++ про разработку Inference-платформы на Triton: почему ушли от Seldon, canary-деплой, автоскейлинг GPU-нод, цепочки моделей на Ray и UI без фронтендеров.
Инференс
На KubeCon подробно рассказали про DRA для GPU: нативный шеринг через TimeSlicing и MPS уже доступен, а динамический MIG обещают в 1.33.
Шеринг GPU
Нужна была форма выбора образа при создании инстанса в JupyterHub. Вместо шаблонов jinja2 нашёл решение попроще: profileList с unlisted_choice в kubespawner.
ML-платформы
Разбираюсь, можно ли в Kubernetes регистрировать GPU под именем модели, как MIG-партиции. Спойлер: только патчем device plugin, а выбрать карту поможет nodeSelector.
Шеринг GPU
На TechDay анонсировали Inference-платформу на базе NVIDIA Triton, которую я разрабатываю. Делюсь записью продуктового доклада и анонсом технического на HighLoad++.
Инференс
В четверг рассказываю на TechDay про наш новый продукт, Inference-платформу на базе NVIDIA Triton: жизненный цикл модели, автоскейлинг, canary-деплой и инференс-граф на Ray.
Инференс
Побывал на AI Conf от Онтико и выписал запомнившиеся доклады: тестирование LLM-приложений, краудсорсинг разметки данных, GPT в обучении моделей.
Карьера и комьюнити
По мотивам вебинара: пошагово разбираю, как в облаке работает автоскейлинг ресурсов с GPU, и показываю схему на практике с vLLM и GPT-2.
Инференс
Как устроен автоскейлинг инференса на GPU в Kubernetes: HPA, автоскейлер нод, GPU Operator и почему пуллинг образов тормозит масштабирование. На практике разворачиваем GPT-2 на vLLM, делаем кастомные метрики через Prometheus Adapter и подаём нагрузку. Пригодится тем, кто готовит ML-сервисы к пиковому трафику.
Инференс
Зову на митап по Kubernetes, где в этот раз я слушатель: доклады от Selectel, Flant, Магнит Tech и Hilbert Team. Подумаем, как переиспользовать это в ML-инфраструктуре.
Карьера и комьюнити
Почему настройка GPU на сервере превращается в головоломку из совместимости фреймворка, драйвера и ядра ОС и как NVIDIA GPU Operator автоматизирует это в Kubernetes. Разбираем мультидрайверность, precompiled driver containers и эффект Манделы в nvidia-smi, а также как мы применяем оператор для автоскейлинга и шеринга GPU.
Шеринг GPU
Через час вебинар: настроим кластер k8s для работы с видеокартами, развернём инференс GPT-2, автоскейлинг нод по трафику и разделение GPU через MIG.
Шеринг GPU · Инференс
В Kubernetes 1.31 можно будет монтировать в под другой контейнер как том. Для ML это способ версионировать веса моделей и конфиги в container registry.
Инференс
Express42 опубликовали результаты State of DevOps 2024. Выписал, что зацепило: рынок облаков, AI-ассистенты, managed-сервисы и навыки DevOps-инженеров.
Перед докладом на PyCon про GPU Operator собрал ссылки, где смотреть зависимости между архитектурой GPU, драйвером, CUDA, ядром ОС и версиями фреймворков.
Шеринг GPU
Текстовая версия доклада с ML-митапа: ML-система по аналогии с производством, подбор конфигурации под ML-нагрузки, поиск узких горлышек и эффективное использование GPU.
Скедулинг и утилизация
Текстовая версия доклада с ML-митапа Selectel: что ML-системам можно взять у заводских конвейеров, как подобрать минимальную конфигурацию под ML-нагрузку, искать узкие горлышки по теории Голдратта и с профайлером. И как потом эффективно утилизировать GPU в обучении и инференсе.
Скедулинг и утилизация
Вернулся с концерта Rammstein. Пока готовлю новый контент, можно послушать подкаст, где я рассказываю про свой опыт в DevOps и задачи, с которыми сталкиваюсь.
Карьера и комьюнити
Уезжаю в отпуск и оставляю подборку для DevOps: awesome-списки, роадмапы, руководства. Источники собирали с коллегами, а структуру помог сделать ChatGPT.
Карьера и комьюнити
Продолжаю разбираться с пуллингом и развёртыванием образов в containerd: пробую nerdctl, eStargz, Nydus, SOCI и zstd на своих образах. Спойлер: мой любимчик - zstd.
Инференс
Моя статья про шеринг GPU в Kubernetes вошла в шорт-лист Технотекста 2023. Вспоминаю, о чём она: несколько подов на одной видеокарте и автомасштабируемый инференс на MIG.
Шеринг GPU · Карьера и комьюнити
Копаю глубже: как устроены пуллинг и распаковка образов и как ленивая загрузка слоёв через Stargz Snapshotter ускоряет старт сервиса.
Инференс
ML-образы весят по 10–15 ГБ, и новая реплика при автоскейлинге поднимается долго. Пробую кеширующий реджестри и выясняю, что узкое место в распаковке слоёв.
Инференс
Перед Admin-митапом Selectel, где я веду программу, делюсь своим подходом к докладам: сначала рассказ, потом слайды. Плюс книги и упражнения, которые помогли.
Карьера и комьюнити
Сегодня выступаю на MLечном пути. Делюсь трансляцией и источниками, по которым готовились: схемы ML-систем, MLOps-принципы, книги про бережливое производство и теорию ограничений.
Скедулинг и утилизация
Начинаю цикл «от автоматизации производств до DevOps»: разбираю принципы бережливого производства на примере программного продукта и кофейного завода.
Коротко о трёх способах поделить видеокарту NVIDIA между задачами: чем отличаются TimeSlicing, MPS и MIG по поддержке GPU и изоляции памяти.
Шеринг GPU
Завожу свой канал: буду делиться исследованиями в DevOps и MLOps, мыслями об инструментах и доп. материалами к статьям на Хабр и выступлениям. И всё это простым языком.
Как мы в отделе DataML-продуктов Selectel ушли от ClickOps и автоматизировали деплой облачной ML-платформы на GitLab и Terraform: от даунстримов к монолитной Terraform-джобе и её распилу через remote state, плюс автотесты. Пригодится тем, кто хочет перестать бояться деплоя в прод.
ML-платформы
Можно ли переразмечать MIG на лету, когда на GPU уже есть нагрузка? Разбираем решения от run.ai и Nebuly, проверяем динамический MIG в Kubernetes на экспериментах и сравниваем TimeSlicing, MPS и MIG на одном тесте. Для тех, кто уже делит видеокарты и хочет делать это гибче.
Шеринг GPU
Продолжение про шеринг GPU, теперь в Kubernetes: как GPU Operator делит видеокарты через MIG и TimeSlicing, как настроить балансировку, мониторинг и автомасштабирование через Prometheus Adapter и HPA. В итоге за вечер собираем прототип автомасштабируемой инференс-платформы.
Шеринг GPU · Инференс
Практическое пособие по шерингу GPU: почему связка «одна GPU на контейнер» неэффективна и чем отличаются CUDA-потоки, TimeSlicing, MIG, MPS и vGPU. Дальше на практике настраиваем MIG, запускаем инференс-серверы на партициях и меряем пропускную способность. Для тех, кто хочет делить видеокарты между задачами и коллегами.
Шеринг GPU