Локальная Gemma увеличила расход токенов вместо экономии при подключении к Codex
Попытка оптимизировать расходы на облачные ИИ-модели путём подключения локальной версии Gemma к Codex привела к удвоению расхода токенов на простые задачи, что сделало интеграцию неэффективной.
Пользователь платформы Habr провёл эксперимент по интеграции локальных версий языковой модели Gemma (gemma3:4b и gemma2:2b), развёрнутых на MacBook Pro 16 2019 года, с облачным сервисом Codex. Основной целью было сокращение затрат на использование Codex за счёт перенаправления простых запросов (разбор логов, traceback, commit messages) на локальную модель.
Несмотря на успешную техническую реализацию интеграции с помощью MCP-сервера, практические результаты оказались противоположными ожидаемым. Тестирование на одинаковых простых задачах показало, что маршрутизация запроса через локальную модель не только не снизила, но и привела к значительному росту потребления токенов. В некоторых случаях расход увеличился вдвое.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!