← Журнал · · Источники доклада
Как мы строили Inference платформу - источники
По следам моего доклада на HighLoad выкладываю источники, которые вам встречались в ходе рассказа. Так сказать все в одном месте в одном сообщении🐹
1. Istio + Canary deploy
Как работает Istio
Как реализовать basic auth
Canary deploy в Istio
2. Autoscaling
Что это такое?
Автоскейлинг в k8s с GPU нодами
Node autoscaler в k8s
Как работает GPU оператор
Ускоряем автоскейлинг
Выносим кеш моделей в PVC S3
Lazy loading образов - как помогает ускорить пуллинг контейнеров
eStargz, SOCI, Nydus - снепшоттеры для ленивой загрузки образов
ZSTD формат образов - быстрее чем gzip
Шерим GPU
MIG, MPS, Timeslicing - технологии шеринга GPU и их сравнение
Бенчмарк для замера производительности GPU на основе YOLOv5
3. Inference Graph
Ray Serve, Ray Cluster - граф на нескольких нодах
Triton ансамбль моделей - граф на одной ноде
4. Оптимизация Triton
Как работает оптимизация Triton
Perf_client - делает нагруженные тесты трайтона
Model Analyzer - подберет конфиг тритона
Model Navigator - подберет формат модели
5. UI интерфейс без разработчиков
Istio дашборд
DCGM дашборд
Triton дашборд
Kiali для визуализации трафика
На этом список источников я закончу, надеюсь вы найдете что то для себя полезное! Те, кто не смог посетить мой доклад - скоро я выложу статьи на хабр с перессказом, где дополню его небольшими уточнениями, так что следите за новостями)
Если у вас остались вопросы после моего доклада - вы можете задать их под этим постом в комментариях или выцепить меня на конференции) Спасибо что послушали доклад, вы классные!😊