Сравнение производительности MLX-серверов на чипах Apple M: MTPLX против oMLX
Пользователь платформы Habr провёл тестирование двух MLX-серверов, MTPLX и oMLX, для запуска языковых моделей на чипах Apple M, выявив значительную разницу в скорости обработки запросов.
В рамках эксперимента было проведено сравнение работы MTPLX, использующего многотокенное предсказание (multi-token prediction), с oMLX, который, по данным ChatGPT, является оптимальным для чипов Apple M4 Max. Тестирование показало, что oMLX обрабатывает запросы в 3–6 раз быстрее MTPLX при работе с языковыми моделями.
Исследование проводилось на MacBook Pro с чипом M4 Max с целью выяснить, насколько функция многотокенного предсказания в MTPLX влияет на производительность по сравнению с другими MLX-обвязками. Результаты наглядно продемонстрировали преимущества oMLX в скорости.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!