← Журнал · · Разбор
Краткий гайд по деплою вашего инференса на GPU
Привет! Недавно на консультации рассказывал гайдлайн, как правильно задеплоить инференс на виртуалке с GPU. Решил поделиться с вами!
🚀 В начале было Слово Железо.
Архитектура GPU Nvidia в сфере датацентровых видеокарт развивается следующим образом:
Volta → Ampere → Hopper → Blackwell
Важные особенности архитектуры (новое поколение включает плюсы предыдущего):
Volta
- доступны MPS на 48 потоков.
Ampere
- MIG — возможность разделения GPU на уровне железа максимум на 7 частей.
- Flash Attention — существенно повышает производительность.
- bfloat16 - прозводительный формат для генеративных моделей
🚀 Драйверы и CUDA
По-умолчанию если нет опеределенных требований ставьте latest версию драйвера в зависимости от ядра вашей ОС.
Также рекомендую изучить мою матрицу зависимостей драйверов, CUDA и фреймворков.
🚀 Docker-образы
Для работы связки Docker → GPU необходим Container Toolkit.
Версия CUDA зашивается внутрь Docker-образа; на хосте ставим только драйвер и Toolkit.
🚀 Фреймворки инференса
Ollama — подходит для GGUF-моделей, отлично для домашнего использования. Запускается одной командой.
vLLM — стандартный выбор для сервинга LLM.
Triton + vLLM — Triton как обертка над vLLM, позволяет использовать метрики DCGM экспортера.
Triton + TensorRT — оптимальный выбор, если не хватает производительности (RPS).
На этом пока что все. Ставьте реакции 🔥, если нужно расписать каждый пункт отдельным постом подробнее! У каждого шага свои особенности и грабли, на которые я уже наступал и мне хотелось бы, чтобы вы их обошли стороной)