← Журнал · · Источники доклада

Как мы строили Inference платформу - источники

По следам моего доклада на HighLoad выкладываю источники, которые вам встречались в ходе рассказа. Так сказать все в одном месте в одном сообщении🐹

1. Istio + Canary deploy

Как работает Istio
Как реализовать basic auth
Canary deploy в Istio

2. Autoscaling

Что это такое?
Автоскейлинг в k8s с GPU нодами
Node autoscaler в k8s
Как работает GPU оператор

Ускоряем автоскейлинг
Выносим кеш моделей в PVC S3
Lazy loading образов - как помогает ускорить пуллинг контейнеров
eStargz, SOCI, Nydus - снепшоттеры для ленивой загрузки образов
ZSTD формат образов - быстрее чем gzip

Шерим GPU
MIG, MPS, Timeslicing - технологии шеринга GPU и их сравнение
Бенчмарк для замера производительности GPU на основе YOLOv5

3. Inference Graph

Ray Serve, Ray Cluster - граф на нескольких нодах
Triton ансамбль моделей - граф на одной ноде

4. Оптимизация Triton

Как работает оптимизация Triton
Perf_client - делает нагруженные тесты трайтона
Model Analyzer - подберет конфиг тритона
Model Navigator - подберет формат модели

5. UI интерфейс без разработчиков

Istio дашборд
DCGM дашборд
Triton дашборд
Kiali для визуализации трафика

На этом список источников я закончу, надеюсь вы найдете что то для себя полезное! Те, кто не смог посетить мой доклад - скоро я выложу статьи на хабр с перессказом, где дополню его небольшими уточнениями, так что следите за новостями)

Если у вас остались вопросы после моего доклада - вы можете задать их под этим постом в комментариях или выцепить меня на конференции) Спасибо что послушали доклад, вы классные!😊

Оригинал в Telegram ↗

↑↓ выбор · Enter открыть · Esc закрыть