Инженер Habr поделился опытом локального развертывания LLM на DGX Spark
Инженер Habr успешно развернул большие языковые модели (LLM) и модель автоматического распознавания речи (ASR) на оборудовании NVIDIA DGX Spark и AMD GPU, подключив их к мультиагентной платформе.
Опыт инженера продемонстрировал, что процесс локального развертывания LLM включает не только работу с файлами моделей, но и решение сложных инженерных задач. Среди них — управление длинным контекстом, конкурирующим с KV-кэшем и параллелизмом, а также адаптация показателей производительности, таких как tokens/sec, к реальной пользовательской задержке.
В процессе развертывания использовались технологии vLLM для оптимизации работы LLM. Также был затронут аспект выбора модели: иногда более быстрая модель может быть заменена на менее производительную, если она обеспечивает лучшее качество результатов, что критично для конечного пользователя.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!