← Журнал · · Разбор

Краткий гайд по деплою вашего инференса на GPU

Привет! Недавно на консультации рассказывал гайдлайн, как правильно задеплоить инференс на виртуалке с GPU. Решил поделиться с вами!

🚀 В начале было Слово Железо.

Архитектура GPU Nvidia в сфере датацентровых видеокарт развивается следующим образом:

Volta → Ampere → Hopper → Blackwell

Важные особенности архитектуры (новое поколение включает плюсы предыдущего):

Volta
- доступны MPS на 48 потоков.

Ampere
- MIG — возможность разделения GPU на уровне железа максимум на 7 частей.
- Flash Attention — существенно повышает производительность.
- bfloat16 - прозводительный формат для генеративных моделей

Интересная статья про GPU

🚀 Драйверы и CUDA

По-умолчанию если нет опеределенных требований ставьте latest версию драйвера в зависимости от ядра вашей ОС.

Также рекомендую изучить мою матрицу зависимостей драйверов, CUDA и фреймворков.

🚀 Docker-образы

Для работы связки Docker → GPU необходим Container Toolkit.

Версия CUDA зашивается внутрь Docker-образа; на хосте ставим только драйвер и Toolkit.

🚀 Фреймворки инференса

Ollama — подходит для GGUF-моделей, отлично для домашнего использования. Запускается одной командой.

vLLM — стандартный выбор для сервинга LLM.

Triton + vLLM — Triton как обертка над vLLM, позволяет использовать метрики DCGM экспортера.

Triton + TensorRT — оптимальный выбор, если не хватает производительности (RPS).

На этом пока что все. Ставьте реакции 🔥, если нужно расписать каждый пункт отдельным постом подробнее! У каждого шага свои особенности и грабли, на которые я уже наступал и мне хотелось бы, чтобы вы их обошли стороной)

Оригинал в Telegram ↗

↑↓ выбор · Enter открыть · Esc закрыть