Журнал

Посты из канала «Инфраструктура для AI и ML» и статьи на Хабре.

Хабр · AvitoTech

ML для больших компаний: от DevBox до платформы на тысячу пользователей ↗

Как ML-платформа в Авито выросла из DevBox-решений и юнит-платформ разных команд в единую платформу на Kubeflow и с какими проблемами мы столкнулись по пути. Отдельно рассказываю про инференс-платформу и то, как могут выглядеть агентские платформы. Пригодится и тем, кто строит платформы в больших компаниях, и тем, кто работает на DevBox или небольших юнит-платформах.

ML-платформы · Инференс

Дайджест

Дайджест mlinfra · 23.06.2026

Speculative decoding от Modal, prefix caching в GKE Inference Gateway, AI-платформа Databricks и Ray на AKS.

Инференс · ML-платформы

Дайджест

Дайджест mlinfra · 17.06.2026

Cloud native становится AI native: DRA, Workload API и Inference Gateway, vLLM в Foundry Local, надёжный LLM-инференс в Databricks и serverless GPU от Modal.

Инференс · LLM и железо

Разбор

GPU-шеринг как у Яндекса, но на open source: Kueue

Собрали шеринг GPU между ML-инженерами, похожий на Dev Cluster Яндекса, на ванильном Kubernetes + Kueue в Kubeflow. Разбираю, из каких сущностей он состоит.

Скедулинг и утилизация · Шеринг GPU

Анонс

Доклад на infra.conf 2026!

4 июня на infra.conf рассказываю, как в Авито строим ML-платформу на Kubeflow: очереди на Kueue, патчи пайплайнов, observability, инференс на KServe и свой model registry.

ML-платформы

Источники доклада

MLечный путь 2026: источники доклада

Ссылки по темам доклада и запись выступления: подходы к MLOps-платформам, профили Kubeflow, Kueue, Istio Sidecar, распределённое обучение и LLM-инференс в KServe.

ML-платформы · Скедулинг и утилизация

Дайджест

Дайджест mlinfra · 21.04.2026

Дайджест накануне MLечного пути: апдейты open source serving-проектов, асинхронный инференс через GKE Inference Gateway и DRANET на AKS.

Инференс

Дайджест

Дайджест mlinfra · 15.04.2026

Сложность уже не в том, как поднять модель, а в том, как ей управлять в production: DRANET, Inference Gateway и inference operator от AWS.

Инференс

Анонс

Мы написали курс по MLOps!

Курс «MLOps для разработки и мониторинга моделей» в Яндекс Практикуме с упором на инфраструктуру: я собирал ядро программы и проектировал инфраструктуру курса.

Карьера и комьюнити

Заметка

Скедулинг AI ворклоудов в k8s

Что уже есть в open source для скедулинга AI-ворклоудов: плагины планировщика с метриками GPU и topology-aware scheduling от NVIDIA.

Скедулинг и утилизация

Дайджест

Дайджест mlinfra · 08.04.2026

Запускаю инфраструктурные дайджесты: доставка тяжёлых весов моделей, AI conformance в Kubernetes, мультинодовый инференс на Dynamo и llm-d в CNCF Sandbox.

Инференс · ML-платформы

Анонс

MLечный путь 2026

22 апреля третий раз выступаю на MLечном пути, теперь про платформизацию: путь от DevBox с JupyterLab до централизованной платформы, Kueue, Kubeflow и агентные платформы.

ML-платформы

Заметка

Платформизация: зачем она и нужна ли вам

Почему компании идут в платформизацию, как я делю ML-платформы на уровни Data, ML и Inference. И открытый вопрос: нужна ли она вам прямо сейчас.

ML-платформы

Личное

Итоги 2025

Подвожу итоги года по трекам: доклады и статьи, менторство и курс по MLOps, жизнь канала и немного личного.

Карьера и комьюнити

Анонс

Подкаст про карьеру в MLOps

Записали подкаст с Юрой Классеном из Купера: как перейти в MLOps, как выглядит типичный рабочий день, с какими болями сталкиваешься и какие навыки нужны на рынке.

Карьера и комьюнити

Разбор

Inference serving platform: в начале было Слово

Начинаю серию постов про инференс-платформы с основ: что такое инференс, чем инференс-сервис отличается от веб-сервиса и зачем отделять бизнес-логику от модели.

Инференс

Анонс

Карьерный митап от self и Звук

Завтра жду на карьерном митапе сообщества self и Звук: поговорим про карьеру в ML и MLOps, собеседования в бигтех и трек развития.

Карьера и комьюнити

Источники доклада

По следам подбора инфраструктуры для LLM

Спасибо, что послушали доклад! Выложил в open source лабораторию для подбора инфраструктуры под LLM и делюсь картинками, которые не попали в презентацию.

LLM и железо

Личное

Вернулся: курс по MLOps, DevOops и статья про LLM

После двух месяцев паузы делюсь планами: пишу курс по MLOps, готовлю доклад про аллокацию GPU-ворклоудов в K8S на DevOops и выпустил первую часть статьи про подбор инфраструктуры для LLM.

Карьера и комьюнити · LLM и железо

Хабр · Selectel

Как приручить LLM: подбор инфраструктуры для инференса. Часть 1 ↗

Первая часть серии о том, как подобрать инфраструктуру под инференс LLM, когда клиент просит «разверните мне Qwen». Разбираемся, из чего складывается требуемая VRAM (параметры модели, активации, KV-кэш, буферы), как подобрать GPU и запустить базовый инференс. Полезно тем, кто впервые прикидывает железо под LLM.

LLM и железо · Инференс

Анонс

Вспомним как готовить triton inference server

На канале Evrone вышла запись моего доклада про частную инсталляцию Inference-платформы. Хороший повод вспомнить, как устроена платформа.

Инференс

Разбор

Как хранить веса модели из HuggingFace в S3

Кеширую веса из HuggingFace в S3 для vLLM. Почему кеш HF не залить как есть и какие есть варианты: rclone, скачивание в локальную папку, тензерирование.

Инференс

Личное

Нас теперь 500 человек!

Нас 500! По этому поводу видео с кластером DGX B200 и немного статистики канала: посты, доклады, статьи, консультации и подкасты.

Карьера и комьюнити

Анонс

ODS в гостях у Selectel!

29 мая веду ODS DataFest в Selectel и рассказываю про узкие горлышки автоскейлинга инференса в k8s, шеринг GPU и скедулеры для ML-нагрузок.

Инференс · Шеринг GPU

Заметка

Как проходил МЛечный путь 2025

Вспоминаем ML-митап Selectel по статье коллеги-организатора. А если нужна текстовая версия моего доклада про подбор инфраструктуры, ставьте реакции.

Карьера и комьюнити

Источники доклада

Перечень полезных источников "Как приручить LLM"

Источники к докладу про подбор инфраструктуры для LLM: оценка VRAM, инференс-фреймворки, конфигурация vLLM и инструменты нагрузочного тестирования.

LLM и железо · Инференс

Разбор

KAI Scheduler - нативный планировщик K8S от Nvidia

Потрогал KAI Scheduler, open source планировщик из Run:ai. Разбираю сущности: очереди с квотами, эластичные ворклоуды, приоритеты и шеринг GPU.

Скедулинг и утилизация · Шеринг GPU

Хабр · Selectel

Как готовить Triton: рецепты вашей собственной Inference-платформы ↗

Гайд по репозиторию с рецептами для NVIDIA Triton Inference Server: демо Inference-платформы с автоскейлингом и canary-деплоем, запуск моделей разных форматов и популярных LLM, подбор конфигурации через Model Navigator и Model Analyzer. Пригодится тем, кто собирает собственный инференс на Triton в Kubernetes.

Инференс

Разбор

Альтернативный шеринг GPU

MIG, MPS и TimeSlicing не единственные варианты. Смотрю на альтернативы: HAMi с vGPU и dynamic-mig, DRA и шеринг в KAI Scheduler.

Шеринг GPU

Анонс

ML митап в Selectel 2025!

23 апреля веду ML-митап Selectel в Петербурге и рассказываю про подбор инфраструктуры для LLM: GPU под инференс, конфигурация vLLM и SGLang, нагрузочное тестирование.

LLM и железо · Инференс

Заметка

NVIDIA Dynamo AI

NVIDIA выпустили open source Dynamo для инференса LLM на нескольких GPU с бэкендами vLLM, SGLang, TensorRT-LLM и mistral.rs. Сам пока не тестировал, но бенчмарки обещаю.

Инференс

Разбор

Краткий гайд по деплою вашего инференса на GPU

Гайдлайн с консультации: как задеплоить инференс на виртуалке с GPU: от архитектур NVIDIA, драйверов и CUDA до Docker-образов и выбора инференс-сервера.

Инференс · LLM и железо

Анонс

Нужны ли публичные выступления разработчику?

Вышел выпуск подкаста «Сегодня на ретро» с моим участием: поговорили про личный бренд, пользу выступлений для работы и стоит ли компаниям вкладываться в разработчиков-спикеров.

Карьера и комьюнити

Заметка

Кто такой MLOps-инженер?

Рынок сам не понимает, кто такой MLOps. Объясняю на диаграмме: три сущности (Data, ML и Inference), вертикали специалистов и горизонтальный пайплайн доставки ценности.

Карьера и комьюнити · ML-платформы

Личное

Ребрендинг и планы на год

Нашёл свою сферу (инфраструктура для ML), поэтому снова переименовываю канал. Делюсь планами исследований на год и тем, с какими вопросами можно ко мне прийти.

Карьера и комьюнити

Личное

Итоги 2024 года

Вспоминаю выступления 2024 года, от DevOps Conf и ML-митапа до PyCon, TechDay и HighLoad++, и делюсь планами на следующий год.

Карьера и комьюнити

Анонс

Запись доклада с Highload++ 24

Выложили записи HighLoad++: мой рассказ про Inference-платформу теперь можно посмотреть вместе с презентацией и ответами на вопросы.

Инференс

Анонс

Вторая часть статьи про Inference платформу!

Завершаю год второй частью на Хабре: как мы реализовали автоскейлинг, canary-деплой, инференс-граф и автоматический подбор конфигурации Triton.

Инференс

Хабр · Selectel

Пять элементов Inference-платформы Selectel. Как мы сделали своего Аватара ↗

Вторая часть про Inference-платформу Selectel: пять фич поверх стандартного Triton в Kubernetes. Это canary-деплой, автоскейлинг с ускорением пуллинга образов, инференс-граф, оптимизация Triton и UI без разработчиков. Для тех, кому мало просто задеплоить Helm chart с Triton.

Инференс

Заметка

Калькулятор расчета GPU памяти для LLM

Нашёл калькулятор, который считает, сколько памяти GPU нужно LLM для обучения или инференса, причём и для готовых моделей, и по вашим параметрам.

LLM и железо

Хабр · Selectel

Nvidia Triton Inference Server: строим production ML без разработчиков ↗

Первая часть рассказа об Inference-платформе Selectel: какие требования мы к ней предъявляли, почему начинали с Seldon Core и в итоге пришли к NVIDIA Triton, как устроены инфраструктура платформы и её доставка клиенту. Полезно тем, кто выбирает, на чём строить свой инференс.

Инференс · ML-платформы

Источники доклада

Как мы строили Inference платформу - источники

Источники к докладу на HighLoad в одном сообщении: Istio и canary-деплой, автоскейлинг, ускорение пуллинга образов, шеринг GPU и не только.

Инференс · Шеринг GPU

Анонс

Доклад на HighLoad++ 2024: Inference-платформа на Triton

Рассказываю на HighLoad++ про разработку Inference-платформы на Triton: почему ушли от Seldon, canary-деплой, автоскейлинг GPU-нод, цепочки моделей на Ray и UI без фронтендеров.

Инференс

Заметка

Нативная поддержка GPU ресурсов в K8S

На KubeCon подробно рассказали про DRA для GPU: нативный шеринг через TimeSlicing и MPS уже доступен, а динамический MIG обещают в 1.33.

Шеринг GPU

Разбор

Кастомные формы в Jupyterhub

Нужна была форма выбора образа при создании инстанса в JupyterHub. Вместо шаблонов jinja2 нашёл решение попроще: profileList с unlisted_choice в kubespawner.

ML-платформы

Анонс

Запустили Inference-платформу Selectel

На TechDay анонсировали Inference-платформу на базе NVIDIA Triton, которую я разрабатываю. Делюсь записью продуктового доклада и анонсом технического на HighLoad++.

Инференс

Анонс

Inference-платформа на Triton: доклад на TechDay

В четверг рассказываю на TechDay про наш новый продукт, Inference-платформу на базе NVIDIA Triton: жизненный цикл модели, автоскейлинг, canary-деплой и инференс-граф на Ray.

Инференс

Заметка

AI Conf 2024: доклады, которые запомнились

Побывал на AI Conf от Онтико и выписал запомнившиеся доклады: тестирование LLM-приложений, краудсорсинг разметки данных, GPT в обучении моделей.

Карьера и комьюнити

Хабр · Selectel

Как справиться с нагрузкой в черную пятницу? Автоскейлинг инференса на GPU в Kubernetes ↗

Как устроен автоскейлинг инференса на GPU в Kubernetes: HPA, автоскейлер нод, GPU Operator и почему пуллинг образов тормозит масштабирование. На практике разворачиваем GPT-2 на vLLM, делаем кастомные метрики через Prometheus Adapter и подаём нагрузку. Пригодится тем, кто готовит ML-сервисы к пиковому трафику.

Инференс

Анонс

Kubernetes-митап в Selectel

Зову на митап по Kubernetes, где в этот раз я слушатель: доклады от Selectel, Flant, Магнит Tech и Hilbert Team. Подумаем, как переиспользовать это в ML-инфраструктуре.

Карьера и комьюнити

Хабр · Selectel

Как котята лапками настраивают GPU в Kubernetes и при чем тут эффект Манделы ↗

Почему настройка GPU на сервере превращается в головоломку из совместимости фреймворка, драйвера и ядра ОС и как NVIDIA GPU Operator автоматизирует это в Kubernetes. Разбираем мультидрайверность, precompiled driver containers и эффект Манделы в nvidia-smi, а также как мы применяем оператор для автоскейлинга и шеринга GPU.

Шеринг GPU

Анонс

Вебинар: настраиваем GPU в Kubernetes с GPU Operator

Через час вебинар: настроим кластер k8s для работы с видеокартами, развернём инференс GPT-2, автоскейлинг нод по трафику и разделение GPU через MIG.

Шеринг GPU · Инференс

Заметка

Read Only Volumes из OCI-артефактов в Kubernetes 1.31

В Kubernetes 1.31 можно будет монтировать в под другой контейнер как том. Для ML это способ версионировать веса моделей и конфиги в container registry.

Инференс

Анонс

Вышла статья: повышаем утилизацию GPU

Текстовая версия доклада с ML-митапа: ML-система по аналогии с производством, подбор конфигурации под ML-нагрузки, поиск узких горлышек и эффективное использование GPU.

Скедулинг и утилизация

Хабр · Selectel

Непреодолимая легкость повышения утилизации GPU ↗

Текстовая версия доклада с ML-митапа Selectel: что ML-системам можно взять у заводских конвейеров, как подобрать минимальную конфигурацию под ML-нагрузку, искать узкие горлышки по теории Голдратта и с профайлером. И как потом эффективно утилизировать GPU в обучении и инференсе.

Скедулинг и утилизация

Личное

Вернулся из отпуска + подкаст про DevOps

Вернулся с концерта Rammstein. Пока готовлю новый контент, можно послушать подкаст, где я рассказываю про свой опыт в DevOps и задачи, с которыми сталкиваюсь.

Карьера и комьюнити

Заметка

Полезные ресурсы для Opsов

Уезжаю в отпуск и оставляю подборку для DevOps: awesome-списки, роадмапы, руководства. Источники собирали с коллегами, а структуру помог сделать ChatGPT.

Карьера и комьюнити

Личное

Статья про шеринг GPU в финале Технотекста

Моя статья про шеринг GPU в Kubernetes вошла в шорт-лист Технотекста 2023. Вспоминаю, о чём она: несколько подов на одной видеокарте и автомасштабируемый инференс на MIG.

Шеринг GPU · Карьера и комьюнити

Разбор

Lazy loading образов через Stargz Snapshotter

Копаю глубже: как устроены пуллинг и распаковка образов и как ленивая загрузка слоёв через Stargz Snapshotter ускоряет старт сервиса.

Инференс

Разбор

Почему ML-образы так долго деплоятся

ML-образы весят по 10–15 ГБ, и новая реплика при автоскейлинге поднимается долго. Пробую кеширующий реджестри и выясняю, что узкое место в распаковке слоёв.

Инференс

Заметка

Как я готовлюсь к выступлениям

Перед Admin-митапом Selectel, где я веду программу, делюсь своим подходом к докладам: сначала рассказ, потом слайды. Плюс книги и упражнения, которые помогли.

Карьера и комьюнити

Источники доклада

MLечный путь 2024: источники к докладу

Сегодня выступаю на MLечном пути. Делюсь трансляцией и источниками, по которым готовились: схемы ML-систем, MLOps-принципы, книги про бережливое производство и теорию ограничений.

Скедулинг и утилизация

Заметка

Бережливое производство для DevOps-инженера

Начинаю цикл «от автоматизации производств до DevOps»: разбираю принципы бережливого производства на примере программного продукта и кофейного завода.

Заметка

Шеринг GPU: TimeSlicing, MPS и MIG

Коротко о трёх способах поделить видеокарту NVIDIA между задачами: чем отличаются TimeSlicing, MPS и MIG по поддержке GPU и изоляции памяти.

Шеринг GPU

Личное

Знакомство: о чём этот канал

Завожу свой канал: буду делиться исследованиями в DevOps и MLOps, мыслями об инструментах и доп. материалами к статьям на Хабр и выступлениям. И всё это простым языком.

Хабр · Selectel

Как мы ускорили деплой облачной платформы в 20 раз и избавились от панических атак ↗

Как мы в отделе DataML-продуктов Selectel ушли от ClickOps и автоматизировали деплой облачной ML-платформы на GitLab и Terraform: от даунстримов к монолитной Terraform-джобе и её распилу через remote state, плюс автотесты. Пригодится тем, кто хочет перестать бояться деплоя в прод.

ML-платформы

Хабр · Selectel

Как разбить видеокарту и поделиться с коллегами? Динамический шеринг GPU в Kubernetes с помощью MIG, MPS и TimeSlicing ↗

Можно ли переразмечать MIG на лету, когда на GPU уже есть нагрузка? Разбираем решения от run.ai и Nebuly, проверяем динамический MIG в Kubernetes на экспериментах и сравниваем TimeSlicing, MPS и MIG на одном тесте. Для тех, кто уже делит видеокарты и хочет делать это гибче.

Шеринг GPU

Хабр · Selectel

Делим неделимое в Kubernetes: шеринг GPU с помощью MIG и TimeSlicing ↗

Продолжение про шеринг GPU, теперь в Kubernetes: как GPU Operator делит видеокарты через MIG и TimeSlicing, как настроить балансировку, мониторинг и автомасштабирование через Prometheus Adapter и HPA. В итоге за вечер собираем прототип автомасштабируемой инференс-платформы.

Шеринг GPU · Инференс

Хабр · Selectel

Как разбить GPU на несколько частей и поделиться с коллегами: практическое пособие по работе с MIG ↗

Практическое пособие по шерингу GPU: почему связка «одна GPU на контейнер» неэффективна и чем отличаются CUDA-потоки, TimeSlicing, MIG, MPS и vGPU. Дальше на практике настраиваем MIG, запускаем инференс-серверы на партициях и меряем пропускную способность. Для тех, кто хочет делить видеокарты между задачами и коллегами.

Шеринг GPU

↑↓ выбор · Enter открыть · Esc закрыть