Достигнута высокая скорость работы ИИ-модели Qwen 3.6B на бюджетном оборудовании
Исследователи смогли запустить 3.6-миллиардную языковую модель Qwen на комбинации видеокарт RTX 5080 и RTX 3060, достигнув скорости 109 токенов в секунду через устаревший интерфейс PCIe Gen2 x4.
Тестирование проводилось на материнской плате B450-Plus, где вторичный слот PCIe Gen2 x4 имеет ограниченную пропускную способность. Несмотря на это, применение архитектуры Mixture-of-Experts (MoE) позволило эффективно распределить нагрузку между двумя различными GPU.
Полученная скорость генерации в 109 токенов в секунду для 3.6-миллиардной модели свидетельствует о потенциале использования менее производительного или устаревшего оборудования для решения задач, требующих значительных вычислительных мощностей. Это открывает новые возможности для оптимизации затрат на развертывание и эксплуатацию ИИ-систем.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!