← Журнал · · Дайджест

Дайджест mlinfra · 17.06.2026

#mlinfra_digest

Всем привет!

Openclaw принес мне свежую порцию интересных статей про инфраструктуру платформ, выделил наиболее актуальные.

1️⃣ Cloud native is now AI-native: Engineering production-ready AI
Cloud native трансформируется в AI native.

На первый план выходят отдельные primitives: DRA, Pod Groups / Workload API, Inference Gateway, плюс разговор уже идёт про AI Conformance и security для agentic flows.

А вы уже во всю тестируете переход на DRA? Или продовый куб отстает на 10 версий от апстрима?)

2️⃣ Scale On-Prem AI with Foundry Local on Azure Local: Multi-Node Inference and vLLM Support
Microsoft в Foundry Local на Azure Local добавили multi-node inference, vLLM runtime и planner, который сам подбирает memory-safe конфиг под модель и железо.

Меня здесь заинтересовал именно planner - как в azure подбирают параметры для vllm. Там еще отличная табличка какие параметры тюнить. Приложил к посту.

3️⃣ Reliable LLM Inference at Scale
У Databricks понравился акцент на том, что в проде проблема не в абстрактных benchmark’ах, а в том, как система ведёт себя под spiky demand.

Они пишут про:

• model-aware capacity planning,
• cost-aware routing,
• autoscaling по реальной стоимости нагрузки,
• recovery от silent failures и деградации latency.

4️⃣ How we achieved truly serverless GPUs
У Modal сильный инженерный разбор того, почему truly serverless GPUs — это сложно.
Ключевая проблема — startup latency, и решают они её через warm GPU buffers, lazy filesystem/image loading, checkpoint/restore и даже CUDA checkpoint/restore.

Я бы добавил еще тензерирование моделек, чтобы быстрее в GPU залетали и RDMA.

Оригинал в Telegram ↗

↑↓ выбор · Enter открыть · Esc закрыть