[Перевод] Я обучил собственную визуально-языковую модель меньше чем на 1 млрд параметров
Habr ·
![[Перевод] Я обучил собственную визуально-языковую модель меньше чем на 1 млрд параметров](https://habrastorage.org/getpro/habr/upload_files/5b7/b0f/84f/5b7b0f84fbf20bf6d6b30e2f417743b3.jpg)
Как собрать собственную визуально-языковую модель с нуля, имея ограниченный бюджет и одну арендованную GPU? Автор эксперимента взял небольшую языковую модель, подключил к ней визуальный энкодер и прошёл весь путь обучения VLM – от настройки архитектуры до оценки качества ответов. В статье – разбор решений, ошибки первых запусков и результаты модели на 628 млн параметров, которая научилась описывать изображения примерно за $200. Смотреть результат
Как собрать собственную визуально-языковую модель с нуля, имея ограниченный бюджет и одну арендованную GPU? Автор эксперимента взял небольшую языковую модель, подключил к ней визуальный энкодер и прошёл весь путь обучения VLM – от настройки архитектуры до оценки качества ответов. В статье – разбор решений, ошибки первых запусков и результаты модели на 628 млн параметров, которая научилась описывать изображения примерно за $200. Смотреть результат