<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>ml-infra.pro · журнал</title><description>Антон Алексеев, MLOps-инженер: GPU в Kubernetes, инференс, ML-платформы. Роадмапы, выступления и журнал по инфраструктуре для ML.</description><link>https://ml-infra.pro/</link><language>ru</language><item><title>ML для больших компаний: статья про ML-платформу на Kubeflow</title><link>https://ml-infra.pro/journal/2026-06-29-122/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-06-29-122/</guid><description>Вышла текстовая версия доклада с infra.conf 2026 про ML-платформу на Kubeflow. Со ссылками на наши PR в community и манифесты, чтобы воспроизвести платформу у себя.</description><pubDate>Mon, 29 Jun 2026 08:21:20 GMT</pubDate></item><item><title>ML для больших компаний: от DevBox до платформы на тысячу пользователей</title><link>https://habr.com/ru/companies/avito/articles/1050838/</link><guid isPermaLink="true">https://habr.com/ru/companies/avito/articles/1050838/</guid><description>Как ML-платформа в Авито выросла из DevBox-решений и юнит-платформ разных команд в единую платформу на Kubeflow и с какими проблемами мы столкнулись по пути. Отдельно рассказываю про инференс-платформу и то, как могут выглядеть агентские платформы. Пригодится и тем, кто строит платформы в больших компаниях, и тем, кто работает на DevBox или небольших юнит-платформах.</description><pubDate>Fri, 26 Jun 2026 00:00:00 GMT</pubDate></item><item><title>Дайджест mlinfra · 23.06.2026</title><link>https://ml-infra.pro/journal/2026-06-23-121/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-06-23-121/</guid><description>Speculative decoding от Modal, prefix caching в GKE Inference Gateway, AI-платформа Databricks и Ray на AKS.</description><pubDate>Tue, 23 Jun 2026 08:09:45 GMT</pubDate></item><item><title>Дайджест mlinfra · 17.06.2026</title><link>https://ml-infra.pro/journal/2026-06-17-120/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-06-17-120/</guid><description>Cloud native становится AI native: DRA, Workload API и Inference Gateway, vLLM в Foundry Local, надёжный LLM-инференс в Databricks и serverless GPU от Modal.</description><pubDate>Wed, 17 Jun 2026 07:49:48 GMT</pubDate></item><item><title>GPU-шеринг как у Яндекса, но на open source: Kueue</title><link>https://ml-infra.pro/journal/2026-06-11-119/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-06-11-119/</guid><description>Собрали шеринг GPU между ML-инженерами, похожий на Dev Cluster Яндекса, на ванильном Kubernetes + Kueue в Kubeflow. Разбираю, из каких сущностей он состоит.</description><pubDate>Thu, 11 Jun 2026 10:12:42 GMT</pubDate></item><item><title>Контрибьюты в Kubeflow Pipelines: ссылки к докладу</title><link>https://ml-infra.pro/journal/2026-06-04-116/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-06-04-116/</guid><description>Как обещал на докладе, ссылки на наши proposal, PR и issue в Kubeflow Pipelines: central driver, оптимизация recurring runs, метрики и диагностика ошибок подов.</description><pubDate>Thu, 04 Jun 2026 15:41:01 GMT</pubDate></item><item><title>Доклад на infra.conf 2026!</title><link>https://ml-infra.pro/journal/2026-05-25-115/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-05-25-115/</guid><description>4 июня на infra.conf рассказываю, как в Авито строим ML-платформу на Kubeflow: очереди на Kueue, патчи пайплайнов, observability, инференс на KServe и свой model registry.</description><pubDate>Mon, 25 May 2026 13:12:38 GMT</pubDate></item><item><title>MLечный путь 2026: источники доклада</title><link>https://ml-infra.pro/journal/2026-04-22-114/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-04-22-114/</guid><description>Ссылки по темам доклада и запись выступления: подходы к MLOps-платформам, профили Kubeflow, Kueue, Istio Sidecar, распределённое обучение и LLM-инференс в KServe.</description><pubDate>Wed, 22 Apr 2026 13:03:01 GMT</pubDate></item><item><title>Дайджест mlinfra · 21.04.2026</title><link>https://ml-infra.pro/journal/2026-04-21-113/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-04-21-113/</guid><description>Дайджест накануне MLечного пути: апдейты open source serving-проектов, асинхронный инференс через GKE Inference Gateway и DRANET на AKS.</description><pubDate>Tue, 21 Apr 2026 13:41:55 GMT</pubDate></item><item><title>Дайджест mlinfra · 15.04.2026</title><link>https://ml-infra.pro/journal/2026-04-15-112/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-04-15-112/</guid><description>Сложность уже не в том, как поднять модель, а в том, как ей управлять в production: DRANET, Inference Gateway и inference operator от AWS.</description><pubDate>Wed, 15 Apr 2026 08:05:52 GMT</pubDate></item><item><title>Мы написали курс по MLOps!</title><link>https://ml-infra.pro/journal/2026-04-14-111/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-04-14-111/</guid><description>Курс «MLOps для разработки и мониторинга моделей» в Яндекс Практикуме с упором на инфраструктуру: я собирал ядро программы и проектировал инфраструктуру курса.</description><pubDate>Tue, 14 Apr 2026 08:02:31 GMT</pubDate></item><item><title>Скедулинг AI ворклоудов в k8s</title><link>https://ml-infra.pro/journal/2026-04-09-110/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-04-09-110/</guid><description>Что уже есть в open source для скедулинга AI-ворклоудов: плагины планировщика с метриками GPU и topology-aware scheduling от NVIDIA.</description><pubDate>Thu, 09 Apr 2026 10:37:06 GMT</pubDate></item><item><title>Дайджест mlinfra · 08.04.2026</title><link>https://ml-infra.pro/journal/2026-04-08-109/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-04-08-109/</guid><description>Запускаю инфраструктурные дайджесты: доставка тяжёлых весов моделей, AI conformance в Kubernetes, мультинодовый инференс на Dynamo и llm-d в CNCF Sandbox.</description><pubDate>Wed, 08 Apr 2026 07:45:13 GMT</pubDate></item><item><title>MLечный путь 2026</title><link>https://ml-infra.pro/journal/2026-04-06-108/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-04-06-108/</guid><description>22 апреля третий раз выступаю на MLечном пути, теперь про платформизацию: путь от DevBox с JupyterLab до централизованной платформы, Kueue, Kubeflow и агентные платформы.</description><pubDate>Mon, 06 Apr 2026 13:48:19 GMT</pubDate></item><item><title>Платформизация: зачем она и нужна ли вам</title><link>https://ml-infra.pro/journal/2026-02-16-105/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2026-02-16-105/</guid><description>Почему компании идут в платформизацию, как я делю ML-платформы на уровни Data, ML и Inference. И открытый вопрос: нужна ли она вам прямо сейчас.</description><pubDate>Mon, 16 Feb 2026 14:18:55 GMT</pubDate></item><item><title>Итоги 2025</title><link>https://ml-infra.pro/journal/2025-12-30-104/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-12-30-104/</guid><description>Подвожу итоги года по трекам: доклады и статьи, менторство и курс по MLOps, жизнь канала и немного личного.</description><pubDate>Tue, 30 Dec 2025 16:58:23 GMT</pubDate></item><item><title>Подкаст про карьеру в MLOps</title><link>https://ml-infra.pro/journal/2025-12-21-101/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-12-21-101/</guid><description>Записали подкаст с Юрой Классеном из Купера: как перейти в MLOps, как выглядит типичный рабочий день, с какими болями сталкиваешься и какие навыки нужны на рынке.</description><pubDate>Sun, 21 Dec 2025 14:10:43 GMT</pubDate></item><item><title>Inference serving platform: в начале было Слово</title><link>https://ml-infra.pro/journal/2025-12-01-98/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-12-01-98/</guid><description>Начинаю серию постов про инференс-платформы с основ: что такое инференс, чем инференс-сервис отличается от веб-сервиса и зачем отделять бизнес-логику от модели.</description><pubDate>Mon, 01 Dec 2025 15:27:44 GMT</pubDate></item><item><title>Карьерный митап от self и Звук</title><link>https://ml-infra.pro/journal/2025-11-29-97/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-11-29-97/</guid><description>Завтра жду на карьерном митапе сообщества self и Звук: поговорим про карьеру в ML и MLOps, собеседования в бигтех и трек развития.</description><pubDate>Sat, 29 Nov 2025 14:50:50 GMT</pubDate></item><item><title>Планы: инференс-платформы, митапы и вторая часть статьи</title><link>https://ml-infra.pro/journal/2025-11-29-96/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-11-29-96/</guid><description>Посты стали реже, но контент есть: исследую инференс-платформы для ML и LLM, хожу на митапы в Москве и пишу вторую часть статьи про подбор инфраструктуры для LLM.</description><pubDate>Sat, 29 Nov 2025 12:55:19 GMT</pubDate></item><item><title>По следам подбора инфраструктуры для LLM</title><link>https://ml-infra.pro/journal/2025-10-04-91/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-10-04-91/</guid><description>Спасибо, что послушали доклад! Выложил в open source лабораторию для подбора инфраструктуры под LLM и делюсь картинками, которые не попали в презентацию.</description><pubDate>Sat, 04 Oct 2025 10:46:36 GMT</pubDate></item><item><title>Анонс выступления на конференции «Я про бэкенд»</title><link>https://ml-infra.pro/journal/2025-09-30-90/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-09-30-90/</guid><description>В субботу рассказываю на «Я про бэкенд», как подбираю инфраструктуру для LLM с GenAI Perf. Новое в докладе: автоматизация подбора через Terraform, vLLM production stack и Argo Workflows.</description><pubDate>Tue, 30 Sep 2025 17:07:04 GMT</pubDate></item><item><title>DevOops - источники доклада GPU-инференс в K8s: ускорение, шеринг и скейлинг без боли</title><link>https://ml-infra.pro/journal/2025-09-17-89/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-09-17-89/</guid><description>Все источники к докладу на DevOops в одном сообщении: инференс как веб-сервис, ускорение автоскейлинга, скедулеры для GPU и шеринг видеокарт.</description><pubDate>Wed, 17 Sep 2025 11:06:24 GMT</pubDate></item><item><title>Вернулся: курс по MLOps, DevOops и статья про LLM</title><link>https://ml-infra.pro/journal/2025-08-29-88/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-08-29-88/</guid><description>После двух месяцев паузы делюсь планами: пишу курс по MLOps, готовлю доклад про аллокацию GPU-ворклоудов в K8S на DevOops и выпустил первую часть статьи про подбор инфраструктуры для LLM.</description><pubDate>Fri, 29 Aug 2025 09:20:15 GMT</pubDate></item><item><title>Как приручить LLM: подбор инфраструктуры для инференса. Часть 1</title><link>https://habr.com/ru/companies/selectel/articles/941784/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/941784/</guid><description>Первая часть серии о том, как подобрать инфраструктуру под инференс LLM, когда клиент просит «разверните мне Qwen». Разбираемся, из чего складывается требуемая VRAM (параметры модели, активации, KV-кэш, буферы), как подобрать GPU и запустить базовый инференс. Полезно тем, кто впервые прикидывает железо под LLM.</description><pubDate>Fri, 29 Aug 2025 00:00:00 GMT</pubDate></item><item><title>Вспомним как готовить triton inference server</title><link>https://ml-infra.pro/journal/2025-06-24-87/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-06-24-87/</guid><description>На канале Evrone вышла запись моего доклада про частную инсталляцию Inference-платформы. Хороший повод вспомнить, как устроена платформа.</description><pubDate>Tue, 24 Jun 2025 11:16:26 GMT</pubDate></item><item><title>Тензерирование или быстрая загрузка весов моделей в GPU</title><link>https://ml-infra.pro/journal/2025-06-06-84/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-06-06-84/</guid><description>Как тензерирование весов ускоряет загрузку модели в GPU при старте vLLM. Внутри замеры на Qwen3-8B и Qwen3-32B и примеры конфигов.</description><pubDate>Fri, 06 Jun 2025 10:01:36 GMT</pubDate></item><item><title>Как хранить веса модели из HuggingFace в S3</title><link>https://ml-infra.pro/journal/2025-06-05-83/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-06-05-83/</guid><description>Кеширую веса из HuggingFace в S3 для vLLM. Почему кеш HF не залить как есть и какие есть варианты: rclone, скачивание в локальную папку, тензерирование.</description><pubDate>Thu, 05 Jun 2025 07:34:42 GMT</pubDate></item><item><title>Нас теперь 500 человек!</title><link>https://ml-infra.pro/journal/2025-05-30-79/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-05-30-79/</guid><description>Нас 500! По этому поводу видео с кластером DGX B200 и немного статистики канала: посты, доклады, статьи, консультации и подкасты.</description><pubDate>Fri, 30 May 2025 07:36:12 GMT</pubDate></item><item><title>Автоскейлинг инференса в k8s: источники доклада</title><link>https://ml-infra.pro/journal/2025-05-29-78/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-05-29-78/</guid><description>Материалы к докладу на ODS Data Fest в одном сообщении: инференс на Triton, автоскейлинг и его ускорение, аллокация и шеринг GPU.</description><pubDate>Thu, 29 May 2025 15:28:01 GMT</pubDate></item><item><title>ODS в гостях у Selectel!</title><link>https://ml-infra.pro/journal/2025-05-27-76/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-05-27-76/</guid><description>29 мая веду ODS DataFest в Selectel и рассказываю про узкие горлышки автоскейлинга инференса в k8s, шеринг GPU и скедулеры для ML-нагрузок.</description><pubDate>Tue, 27 May 2025 15:14:20 GMT</pubDate></item><item><title>Как проходил МЛечный путь 2025</title><link>https://ml-infra.pro/journal/2025-05-14-75/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-05-14-75/</guid><description>Вспоминаем ML-митап Selectel по статье коллеги-организатора. А если нужна текстовая версия моего доклада про подбор инфраструктуры, ставьте реакции.</description><pubDate>Wed, 14 May 2025 12:55:29 GMT</pubDate></item><item><title>Перечень полезных источников &quot;Как приручить LLM&quot;</title><link>https://ml-infra.pro/journal/2025-04-23-74/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-04-23-74/</guid><description>Источники к докладу про подбор инфраструктуры для LLM: оценка VRAM, инференс-фреймворки, конфигурация vLLM и инструменты нагрузочного тестирования.</description><pubDate>Wed, 23 Apr 2025 15:32:41 GMT</pubDate></item><item><title>KAI Scheduler - нативный планировщик K8S от Nvidia</title><link>https://ml-infra.pro/journal/2025-04-18-72/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-04-18-72/</guid><description>Потрогал KAI Scheduler, open source планировщик из Run:ai. Разбираю сущности: очереди с квотами, эластичные ворклоуды, приоритеты и шеринг GPU.</description><pubDate>Fri, 18 Apr 2025 14:20:43 GMT</pubDate></item><item><title>Как готовить Triton: рецепты вашей инференс платформы</title><link>https://ml-infra.pro/journal/2025-04-17-71/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-04-17-71/</guid><description>Вышла статья-гайд по репозиторию с туториалами по Triton Inference Server: демо платформы, деплой разных форматов моделей и LLM, автоподбор конфигурации и простые UI.</description><pubDate>Thu, 17 Apr 2025 13:32:16 GMT</pubDate></item><item><title>Как готовить Triton: рецепты вашей собственной Inference-платформы</title><link>https://habr.com/ru/companies/selectel/articles/901358/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/901358/</guid><description>Гайд по репозиторию с рецептами для NVIDIA Triton Inference Server: демо Inference-платформы с автоскейлингом и canary-деплоем, запуск моделей разных форматов и популярных LLM, подбор конфигурации через Model Navigator и Model Analyzer. Пригодится тем, кто собирает собственный инференс на Triton в Kubernetes.</description><pubDate>Thu, 17 Apr 2025 00:00:00 GMT</pubDate></item><item><title>Как приручить LLM: подбор инфраструктуры для инференса без головной боли</title><link>https://ml-infra.pro/journal/2025-04-16-70/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-04-16-70/</guid><description>Так называется мой доклад на ML-митапе Selectel 23 апреля. А по картинке можно угадать, в какой франшизе пойдёт рассказ и что я думаю про TensorRT-LLM.</description><pubDate>Wed, 16 Apr 2025 09:01:19 GMT</pubDate></item><item><title>Альтернативный шеринг GPU</title><link>https://ml-infra.pro/journal/2025-04-10-66/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-04-10-66/</guid><description>MIG, MPS и TimeSlicing не единственные варианты. Смотрю на альтернативы: HAMi с vGPU и dynamic-mig, DRA и шеринг в KAI Scheduler.</description><pubDate>Thu, 10 Apr 2025 07:29:02 GMT</pubDate></item><item><title>ML митап в Selectel 2025!</title><link>https://ml-infra.pro/journal/2025-04-02-65/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-04-02-65/</guid><description>23 апреля веду ML-митап Selectel в Петербурге и рассказываю про подбор инфраструктуры для LLM: GPU под инференс, конфигурация vLLM и SGLang, нагрузочное тестирование.</description><pubDate>Wed, 02 Apr 2025 11:43:48 GMT</pubDate></item><item><title>Анонс выступления на DevOps митапе Островка!</title><link>https://ml-infra.pro/journal/2025-03-24-64/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-03-24-64/</guid><description>27 марта в Москве рассказываю про автоскейлинг инференса в K8S: scale to zero и scale from zero, кеширование образов и ускорение пуллинга.</description><pubDate>Mon, 24 Mar 2025 09:57:00 GMT</pubDate></item><item><title>NVIDIA Dynamo AI</title><link>https://ml-infra.pro/journal/2025-03-20-63/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-03-20-63/</guid><description>NVIDIA выпустили open source Dynamo для инференса LLM на нескольких GPU с бэкендами vLLM, SGLang, TensorRT-LLM и mistral.rs. Сам пока не тестировал, но бенчмарки обещаю.</description><pubDate>Thu, 20 Mar 2025 18:06:14 GMT</pubDate></item><item><title>Краткий гайд по деплою вашего инференса на GPU</title><link>https://ml-infra.pro/journal/2025-03-17-62/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-03-17-62/</guid><description>Гайдлайн с консультации: как задеплоить инференс на виртуалке с GPU: от архитектур NVIDIA, драйверов и CUDA до Docker-образов и выбора инференс-сервера.</description><pubDate>Mon, 17 Mar 2025 08:52:15 GMT</pubDate></item><item><title>Нужны ли публичные выступления разработчику?</title><link>https://ml-infra.pro/journal/2025-02-26-61/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-02-26-61/</guid><description>Вышел выпуск подкаста «Сегодня на ретро» с моим участием: поговорили про личный бренд, пользу выступлений для работы и стоит ли компаниям вкладываться в разработчиков-спикеров.</description><pubDate>Wed, 26 Feb 2025 16:42:04 GMT</pubDate></item><item><title>Кто такой MLOps-инженер?</title><link>https://ml-infra.pro/journal/2025-02-19-60/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-02-19-60/</guid><description>Рынок сам не понимает, кто такой MLOps. Объясняю на диаграмме: три сущности (Data, ML и Inference), вертикали специалистов и горизонтальный пайплайн доставки ценности.</description><pubDate>Wed, 19 Feb 2025 10:34:29 GMT</pubDate></item><item><title>Ребрендинг и планы на год</title><link>https://ml-infra.pro/journal/2025-02-12-58/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2025-02-12-58/</guid><description>Нашёл свою сферу (инфраструктура для ML), поэтому снова переименовываю канал. Делюсь планами исследований на год и тем, с какими вопросами можно ко мне прийти.</description><pubDate>Wed, 12 Feb 2025 08:03:02 GMT</pubDate></item><item><title>Итоги 2024 года</title><link>https://ml-infra.pro/journal/2024-12-31-47/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-12-31-47/</guid><description>Вспоминаю выступления 2024 года, от DevOps Conf и ML-митапа до PyCon, TechDay и HighLoad++, и делюсь планами на следующий год.</description><pubDate>Tue, 31 Dec 2024 14:22:10 GMT</pubDate></item><item><title>Запись доклада с Highload++ 24</title><link>https://ml-infra.pro/journal/2024-12-28-45/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-12-28-45/</guid><description>Выложили записи HighLoad++: мой рассказ про Inference-платформу теперь можно посмотреть вместе с презентацией и ответами на вопросы.</description><pubDate>Sat, 28 Dec 2024 11:02:11 GMT</pubDate></item><item><title>Вторая часть статьи про Inference платформу!</title><link>https://ml-infra.pro/journal/2024-12-27-44/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-12-27-44/</guid><description>Завершаю год второй частью на Хабре: как мы реализовали автоскейлинг, canary-деплой, инференс-граф и автоматический подбор конфигурации Triton.</description><pubDate>Fri, 27 Dec 2024 08:09:26 GMT</pubDate></item><item><title>Пять элементов Inference-платформы Selectel. Как мы сделали своего Аватара</title><link>https://habr.com/ru/companies/selectel/articles/867972/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/867972/</guid><description>Вторая часть про Inference-платформу Selectel: пять фич поверх стандартного Triton в Kubernetes. Это canary-деплой, автоскейлинг с ускорением пуллинга образов, инференс-граф, оптимизация Triton и UI без разработчиков. Для тех, кому мало просто задеплоить Helm chart с Triton.</description><pubDate>Fri, 27 Dec 2024 00:00:00 GMT</pubDate></item><item><title>Калькулятор расчета GPU памяти для LLM</title><link>https://ml-infra.pro/journal/2024-12-18-43/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-12-18-43/</guid><description>Нашёл калькулятор, который считает, сколько памяти GPU нужно LLM для обучения или инференса, причём и для готовых моделей, и по вашим параметрам.</description><pubDate>Wed, 18 Dec 2024 12:51:04 GMT</pubDate></item><item><title>Вышла первая часть статьи про inference платформу!</title><link>https://ml-infra.pro/journal/2024-12-16-42/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-12-16-42/</guid><description>Первая часть по мотивам доклада на HighLoad: требования к платформе, почему начинали с Seldon и отказались от него и как платформа выглядит сейчас.</description><pubDate>Mon, 16 Dec 2024 08:42:47 GMT</pubDate></item><item><title>Nvidia Triton Inference Server: строим production ML без разработчиков</title><link>https://habr.com/ru/companies/selectel/articles/866256/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/866256/</guid><description>Первая часть рассказа об Inference-платформе Selectel: какие требования мы к ней предъявляли, почему начинали с Seldon Core и в итоге пришли к NVIDIA Triton, как устроены инфраструктура платформы и её доставка клиенту. Полезно тем, кто выбирает, на чём строить свой инференс.</description><pubDate>Mon, 16 Dec 2024 00:00:00 GMT</pubDate></item><item><title>Как мы строили Inference платформу - источники</title><link>https://ml-infra.pro/journal/2024-12-02-41/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-12-02-41/</guid><description>Источники к докладу на HighLoad в одном сообщении: Istio и canary-деплой, автоскейлинг, ускорение пуллинга образов, шеринг GPU и не только.</description><pubDate>Mon, 02 Dec 2024 07:40:27 GMT</pubDate></item><item><title>Доклад на HighLoad++ 2024: Inference-платформа на Triton</title><link>https://ml-infra.pro/journal/2024-11-27-39/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-11-27-39/</guid><description>Рассказываю на HighLoad++ про разработку Inference-платформы на Triton: почему ушли от Seldon, canary-деплой, автоскейлинг GPU-нод, цепочки моделей на Ray и UI без фронтендеров.</description><pubDate>Wed, 27 Nov 2024 14:41:09 GMT</pubDate></item><item><title>Нативная поддержка GPU ресурсов в K8S</title><link>https://ml-infra.pro/journal/2024-11-15-36/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-11-15-36/</guid><description>На KubeCon подробно рассказали про DRA для GPU: нативный шеринг через TimeSlicing и MPS уже доступен, а динамический MIG обещают в 1.33.</description><pubDate>Fri, 15 Nov 2024 08:46:46 GMT</pubDate></item><item><title>Кастомные формы в Jupyterhub</title><link>https://ml-infra.pro/journal/2024-11-06-35/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-11-06-35/</guid><description>Нужна была форма выбора образа при создании инстанса в JupyterHub. Вместо шаблонов jinja2 нашёл решение попроще: profileList с unlisted_choice в kubespawner.</description><pubDate>Wed, 06 Nov 2024 10:00:37 GMT</pubDate></item><item><title>Можно ли переименовать nvidia.com/gpu в модель видеокарты</title><link>https://ml-infra.pro/journal/2024-10-30-33/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-10-30-33/</guid><description>Разбираюсь, можно ли в Kubernetes регистрировать GPU под именем модели, как MIG-партиции. Спойлер: только патчем device plugin, а выбрать карту поможет nodeSelector.</description><pubDate>Wed, 30 Oct 2024 13:53:53 GMT</pubDate></item><item><title>Запустили Inference-платформу Selectel</title><link>https://ml-infra.pro/journal/2024-10-11-32/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-10-11-32/</guid><description>На TechDay анонсировали Inference-платформу на базе NVIDIA Triton, которую я разрабатываю. Делюсь записью продуктового доклада и анонсом технического на HighLoad++.</description><pubDate>Fri, 11 Oct 2024 14:30:43 GMT</pubDate></item><item><title>Inference-платформа на Triton: доклад на TechDay</title><link>https://ml-infra.pro/journal/2024-10-08-31/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-10-08-31/</guid><description>В четверг рассказываю на TechDay про наш новый продукт, Inference-платформу на базе NVIDIA Triton: жизненный цикл модели, автоскейлинг, canary-деплой и инференс-граф на Ray.</description><pubDate>Tue, 08 Oct 2024 14:45:07 GMT</pubDate></item><item><title>AI Conf 2024: доклады, которые запомнились</title><link>https://ml-infra.pro/journal/2024-09-28-30/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-09-28-30/</guid><description>Побывал на AI Conf от Онтико и выписал запомнившиеся доклады: тестирование LLM-приложений, краудсорсинг разметки данных, GPT в обучении моделей.</description><pubDate>Sat, 28 Sep 2024 11:25:33 GMT</pubDate></item><item><title>Вышла статья про автоскейлинг инференса в Kubernetes</title><link>https://ml-infra.pro/journal/2024-09-18-29/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-09-18-29/</guid><description>По мотивам вебинара: пошагово разбираю, как в облаке работает автоскейлинг ресурсов с GPU, и показываю схему на практике с vLLM и GPT-2.</description><pubDate>Wed, 18 Sep 2024 16:58:11 GMT</pubDate></item><item><title>Как справиться с нагрузкой в черную пятницу? Автоскейлинг инференса на GPU в Kubernetes</title><link>https://habr.com/ru/companies/selectel/articles/844026/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/844026/</guid><description>Как устроен автоскейлинг инференса на GPU в Kubernetes: HPA, автоскейлер нод, GPU Operator и почему пуллинг образов тормозит масштабирование. На практике разворачиваем GPT-2 на vLLM, делаем кастомные метрики через Prometheus Adapter и подаём нагрузку. Пригодится тем, кто готовит ML-сервисы к пиковому трафику.</description><pubDate>Wed, 18 Sep 2024 00:00:00 GMT</pubDate></item><item><title>Kubernetes-митап в Selectel</title><link>https://ml-infra.pro/journal/2024-09-10-28/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-09-10-28/</guid><description>Зову на митап по Kubernetes, где в этот раз я слушатель: доклады от Selectel, Flant, Магнит Tech и Hilbert Team. Подумаем, как переиспользовать это в ML-инфраструктуре.</description><pubDate>Tue, 10 Sep 2024 09:50:06 GMT</pubDate></item><item><title>Как котята лапками настраивают GPU в Kubernetes и при чем тут эффект Манделы</title><link>https://habr.com/ru/companies/selectel/articles/839528/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/839528/</guid><description>Почему настройка GPU на сервере превращается в головоломку из совместимости фреймворка, драйвера и ядра ОС и как NVIDIA GPU Operator автоматизирует это в Kubernetes. Разбираем мультидрайверность, precompiled driver containers и эффект Манделы в nvidia-smi, а также как мы применяем оператор для автоскейлинга и шеринга GPU.</description><pubDate>Fri, 30 Aug 2024 00:00:00 GMT</pubDate></item><item><title>Вебинар: настраиваем GPU в Kubernetes с GPU Operator</title><link>https://ml-infra.pro/journal/2024-08-29-26/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-08-29-26/</guid><description>Через час вебинар: настроим кластер k8s для работы с видеокартами, развернём инференс GPT-2, автоскейлинг нод по трафику и разделение GPU через MIG.</description><pubDate>Thu, 29 Aug 2024 11:56:56 GMT</pubDate></item><item><title>Read Only Volumes из OCI-артефактов в Kubernetes 1.31</title><link>https://ml-infra.pro/journal/2024-08-27-25/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-08-27-25/</guid><description>В Kubernetes 1.31 можно будет монтировать в под другой контейнер как том. Для ML это способ версионировать веса моделей и конфиги в container registry.</description><pubDate>Tue, 27 Aug 2024 09:20:37 GMT</pubDate></item><item><title>State of DevOps 2024: что интересного про облако</title><link>https://ml-infra.pro/journal/2024-08-17-24/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-08-17-24/</guid><description>Express42 опубликовали результаты State of DevOps 2024. Выписал, что зацепило: рынок облаков, AI-ассистенты, managed-сервисы и навыки DevOps-инженеров.</description><pubDate>Sat, 17 Aug 2024 13:03:50 GMT</pubDate></item><item><title>Совместимость драйверов, CUDA и фреймворков: ссылки к докладу на PyCon</title><link>https://ml-infra.pro/journal/2024-07-24-23/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-07-24-23/</guid><description>Перед докладом на PyCon про GPU Operator собрал ссылки, где смотреть зависимости между архитектурой GPU, драйвером, CUDA, ядром ОС и версиями фреймворков.</description><pubDate>Wed, 24 Jul 2024 10:04:39 GMT</pubDate></item><item><title>Вышла статья: повышаем утилизацию GPU</title><link>https://ml-infra.pro/journal/2024-06-27-21/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-06-27-21/</guid><description>Текстовая версия доклада с ML-митапа: ML-система по аналогии с производством, подбор конфигурации под ML-нагрузки, поиск узких горлышек и эффективное использование GPU.</description><pubDate>Thu, 27 Jun 2024 13:02:35 GMT</pubDate></item><item><title>Непреодолимая легкость повышения утилизации GPU</title><link>https://habr.com/ru/companies/selectel/articles/822651/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/822651/</guid><description>Текстовая версия доклада с ML-митапа Selectel: что ML-системам можно взять у заводских конвейеров, как подобрать минимальную конфигурацию под ML-нагрузку, искать узкие горлышки по теории Голдратта и с профайлером. И как потом эффективно утилизировать GPU в обучении и инференсе.</description><pubDate>Thu, 27 Jun 2024 00:00:00 GMT</pubDate></item><item><title>Вернулся из отпуска + подкаст про DevOps</title><link>https://ml-infra.pro/journal/2024-06-21-20/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-06-21-20/</guid><description>Вернулся с концерта Rammstein. Пока готовлю новый контент, можно послушать подкаст, где я рассказываю про свой опыт в DevOps и задачи, с которыми сталкиваюсь.</description><pubDate>Fri, 21 Jun 2024 14:04:27 GMT</pubDate></item><item><title>Полезные ресурсы для Opsов</title><link>https://ml-infra.pro/journal/2024-06-09-19/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-06-09-19/</guid><description>Уезжаю в отпуск и оставляю подборку для DevOps: awesome-списки, роадмапы, руководства. Источники собирали с коллегами, а структуру помог сделать ChatGPT.</description><pubDate>Sun, 09 Jun 2024 04:38:53 GMT</pubDate></item><item><title>Ускоряем пуллинг образов: eStargz, Nydus, SOCI и zstd</title><link>https://ml-infra.pro/journal/2024-05-26-17/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-05-26-17/</guid><description>Продолжаю разбираться с пуллингом и развёртыванием образов в containerd: пробую nerdctl, eStargz, Nydus, SOCI и zstd на своих образах. Спойлер: мой любимчик - zstd.</description><pubDate>Sun, 26 May 2024 10:37:17 GMT</pubDate></item><item><title>Статья про шеринг GPU в финале Технотекста</title><link>https://ml-infra.pro/journal/2024-05-15-16/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-05-15-16/</guid><description>Моя статья про шеринг GPU в Kubernetes вошла в шорт-лист Технотекста 2023. Вспоминаю, о чём она: несколько подов на одной видеокарте и автомасштабируемый инференс на MIG.</description><pubDate>Wed, 15 May 2024 15:08:34 GMT</pubDate></item><item><title>Lazy loading образов через Stargz Snapshotter</title><link>https://ml-infra.pro/journal/2024-05-08-15/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-05-08-15/</guid><description>Копаю глубже: как устроены пуллинг и распаковка образов и как ленивая загрузка слоёв через Stargz Snapshotter ускоряет старт сервиса.</description><pubDate>Wed, 08 May 2024 10:55:41 GMT</pubDate></item><item><title>Почему ML-образы так долго деплоятся</title><link>https://ml-infra.pro/journal/2024-05-08-14/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-05-08-14/</guid><description>ML-образы весят по 10–15 ГБ, и новая реплика при автоскейлинге поднимается долго. Пробую кеширующий реджестри и выясняю, что узкое место в распаковке слоёв.</description><pubDate>Wed, 08 May 2024 10:55:12 GMT</pubDate></item><item><title>Как я готовлюсь к выступлениям</title><link>https://ml-infra.pro/journal/2024-04-24-13/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-04-24-13/</guid><description>Перед Admin-митапом Selectel, где я веду программу, делюсь своим подходом к докладам: сначала рассказ, потом слайды. Плюс книги и упражнения, которые помогли.</description><pubDate>Wed, 24 Apr 2024 15:09:42 GMT</pubDate></item><item><title>MLечный путь 2024: источники к докладу</title><link>https://ml-infra.pro/journal/2024-04-18-9/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-04-18-9/</guid><description>Сегодня выступаю на MLечном пути. Делюсь трансляцией и источниками, по которым готовились: схемы ML-систем, MLOps-принципы, книги про бережливое производство и теорию ограничений.</description><pubDate>Thu, 18 Apr 2024 15:05:08 GMT</pubDate></item><item><title>Бережливое производство для DevOps-инженера</title><link>https://ml-infra.pro/journal/2024-04-17-8/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-04-17-8/</guid><description>Начинаю цикл «от автоматизации производств до DevOps»: разбираю принципы бережливого производства на примере программного продукта и кофейного завода.</description><pubDate>Wed, 17 Apr 2024 19:21:12 GMT</pubDate></item><item><title>Шеринг GPU: TimeSlicing, MPS и MIG</title><link>https://ml-infra.pro/journal/2024-04-04-6/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-04-04-6/</guid><description>Коротко о трёх способах поделить видеокарту NVIDIA между задачами: чем отличаются TimeSlicing, MPS и MIG по поддержке GPU и изоляции памяти.</description><pubDate>Thu, 04 Apr 2024 11:36:24 GMT</pubDate></item><item><title>Знакомство: о чём этот канал</title><link>https://ml-infra.pro/journal/2024-04-04-4/</link><guid isPermaLink="true">https://ml-infra.pro/journal/2024-04-04-4/</guid><description>Завожу свой канал: буду делиться исследованиями в DevOps и MLOps, мыслями об инструментах и доп. материалами к статьям на Хабр и выступлениям. И всё это простым языком.</description><pubDate>Thu, 04 Apr 2024 08:39:38 GMT</pubDate></item><item><title>Как мы ускорили деплой облачной платформы в 20 раз и избавились от панических атак</title><link>https://habr.com/ru/companies/selectel/articles/803883/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/803883/</guid><description>Как мы в отделе DataML-продуктов Selectel ушли от ClickOps и автоматизировали деплой облачной ML-платформы на GitLab и Terraform: от даунстримов к монолитной Terraform-джобе и её распилу через remote state, плюс автотесты. Пригодится тем, кто хочет перестать бояться деплоя в прод.</description><pubDate>Thu, 04 Apr 2024 00:00:00 GMT</pubDate></item><item><title>Как разбить видеокарту и поделиться с коллегами? Динамический шеринг GPU в Kubernetes с помощью MIG, MPS и TimeSlicing</title><link>https://habr.com/ru/companies/selectel/articles/776132/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/776132/</guid><description>Можно ли переразмечать MIG на лету, когда на GPU уже есть нагрузка? Разбираем решения от run.ai и Nebuly, проверяем динамический MIG в Kubernetes на экспериментах и сравниваем TimeSlicing, MPS и MIG на одном тесте. Для тех, кто уже делит видеокарты и хочет делать это гибче.</description><pubDate>Fri, 24 Nov 2023 00:00:00 GMT</pubDate></item><item><title>Делим неделимое в Kubernetes: шеринг GPU с помощью MIG и TimeSlicing</title><link>https://habr.com/ru/companies/selectel/articles/756934/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/756934/</guid><description>Продолжение про шеринг GPU, теперь в Kubernetes: как GPU Operator делит видеокарты через MIG и TimeSlicing, как настроить балансировку, мониторинг и автомасштабирование через Prometheus Adapter и HPA. В итоге за вечер собираем прототип автомасштабируемой инференс-платформы.</description><pubDate>Wed, 30 Aug 2023 00:00:00 GMT</pubDate></item><item><title>Как разбить GPU на несколько частей и поделиться с коллегами: практическое пособие по работе с MIG</title><link>https://habr.com/ru/companies/selectel/articles/748544/</link><guid isPermaLink="true">https://habr.com/ru/companies/selectel/articles/748544/</guid><description>Практическое пособие по шерингу GPU: почему связка «одна GPU на контейнер» неэффективна и чем отличаются CUDA-потоки, TimeSlicing, MIG, MPS и vGPU. Дальше на практике настраиваем MIG, запускаем инференс-серверы на партициях и меряем пропускную способность. Для тех, кто хочет делить видеокарты между задачами и коллегами.</description><pubDate>Tue, 18 Jul 2023 00:00:00 GMT</pubDate></item></channel></rss>