Разработана визуально-языковая модель с бюджетом в $200
Независимый разработчик создал собственную визуально-языковую модель (VLM) с менее чем миллиардом параметров, используя ограниченный бюджет и одну арендованную видеокарту.
Модель, имеющая 628 миллионов параметров, научилась описывать изображения. Разработка заняла минимальные ресурсы: стоимость проекта составила около $200. Это демонстрирует, что для создания функциональных ИИ-решений в области мультимодальных моделей необязательно иметь крупные ресурсы и многомиллионные бюджеты, как у больших корпораций.
Эксперимент включал выбор небольшой языковой модели и подключение к ней визуального энкодера. Автор прошёл весь путь обучения VLM, начиная от настройки архитектуры и заканчивая оценкой качества сгенерированных ответов. В ходе работы были учтены ошибки первых запусков и оптимизированы многие этапы, чтобы добиться поставленной цели с минимальными затратами.
Успешное создание подобной модели открывает новые возможности для стартапов и небольших команд, заинтересованных в разработке специализированных ИИ-продуктов. Это также показывает потенциал демократизации доступа к технологиям искусственного интеллекта, делая их более доступными для широкого круга исследователей и разработчиков.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!