GPU в Kubernetes
Проблема: GPU в кластере есть, а поды её не видят или падают на несовместимой CUDA.
- драйверы и GPU Operator одной версией на все ноды
- матрица совместимости драйвер / CUDA / фреймворк
- ноды и кластер описаны кодом
Путь от первой GPU в кластере до платформы, на которой команды сами обучают и деплоят модели. На каждом шаге: какая проблема появляется, как её решать и где я об этом писал или рассказывал.
Проблема: GPU в кластере есть, а поды её не видят или падают на несовместимой CUDA.
Проблема: Модель не влезла в карту, или влезла, но под KV-кэш не осталось места.
Проблема: Модель живёт в ноутбуке у DS, а в прод её выкатывают руками.
Проблема: Каждый ноутбук и пайплайн заводится тикетом в DevOps.
Проблема: Новая реплика поднимается минутами: образы и веса на десятки гигабайт.
Проблема: HPA по CPU не видит нагрузку на GPU, а пики приходят быстрее, чем стартуют реплики.
Проблема: Под маленькую модель отдали целую A100, и она простаивает.
Проблема: GPU заняты, но не загружены, а команды стоят в очереди.
Проблема: Каждая команда строит свой велосипед для обучения и инференса.