← Журнал · · Дайджест

Дайджест mlinfra · 23.06.2026

#mlinfra_digest

Снова подборочка от моего разнорабочего.

1️⃣ Speculation Is All You Need
🔎 О чём: Modal показывает, что speculative decoding даёт 2–3x прирост интерактивного inference и выпускает новые DFlash draft models для Qwen.

2️⃣ GKE Inference Gateway prefix caching accelerates AI inference
🔎 О чём: Google описывает prefix-cache-aware routing в GKE Inference Gateway и приводит бенчмарки по throughput, wait time и inter-token latency.

3️⃣ What’s New in the AI Platform: Agents for ML Engineering, Our Deep Learning Platform, and New Capabilities for Real-Time ML
🔎 О чём: Databricks анонсировал serverless GPU AI Runtime, усиление real-time serving и ML-агента, встроенного в feature/training/serving/monitoring контур.

4️⃣ Anyscale on Azure: Powering Enterprise AI at Massive Scale on Azure Kubernetes Service
🔎 О чём: Microsoft и Anyscale продвигают Ray как единый runtime для data prep, training, fine-tuning, inference и agentic execution поверх AKS.

5️⃣ Portable vLLM Model Inference Kernels in Helion
🔎 О чём: PyTorch/Red Hat интегрировали Helion kernels в vLLM для FP8-serving на Qwen3 и показали прирост throughput в fusion-heavy inference path.

Оригинал в Telegram ↗

↑↓ выбор · Enter открыть · Esc закрыть