← Журнал · · Анонс

Доклад на HighLoad++ 2024: Inference-платформа на Triton

Уже на следующей неделе я буду выступать на Highload++ 2024 - расскажу про наш опыт разработки Inference платформы на базе Nvidia Triton Server.
Поделюсь с вами следующим
- Почему мы отказались от Seldon
- Как реализовали канареечный деплой моделей
- Каким образом происходит автоскейлинг нод с GPU в k8s
- Как создать цепочку моделей с помощью Ray
- Что даст оптимизация triton на GPU и как подбирать лучшую конфигурацию автоматически
- Как мы реализовали UI без фронтендеров

Приходите на выступление 2 декабря в 10:00 в зал 11! Отвечу на ваши попросы и просто поделимся опытом)

Также на правах рекламы - сейчас мы выходим на вторую стадию разработки нашей платформы и ищем GO разработчика в нашу команду! Если вы интересуетесь ML и имеете опыт в Go разработке (а предстоит писать бекенд к нашей платформе и возможно даже k8s оператор!) - пишите мне в личку) Сама вакансия здесь

Оригинал в Telegram ↗

↑↓ выбор · Enter открыть · Esc закрыть