← Журнал · · Источники доклада

Перечень полезных источников "Как приручить LLM"

Друзья, делюсь с вами полезными источниками, на основе которых рассказывал про подбор инфраструктуры для LLM

- Карточка модели Qwen со страницы HuggingFace
- Статья про оценку VRam при подборе GPU
- Онлайн калькулятор подсчета VRam
- Инференс фреймворки Ollama, SGLang, VLLM
- Конфигурация VLLM
- Инструменты нагрузочного тестирования locust, k6, gatling, apache jmeter, яндекс танк
- Инструмент нагрузочного тестирования для инференеса от Nvidia - perf analyzer, gen ai perf
- Режимы gen ai perf - Analyze, Sessions
- Квантиазции GGUF, AWQ, GPTQ
- Бекенды Triton для LLM - VLLM, TensoRT LLM
- Утилита для импорта конфигурации Triton для LLM
- Бенчмарки TensorRT LLM
- Статья сравнения инференсов для LLM от bentoML cloud

Как вам доклад? Оставляйте свои реакции и комменты!

Оригинал в Telegram ↗

↑↓ выбор · Enter открыть · Esc закрыть