Как сделать интерактивного агента с помощью KV‑кеш‑манипуляций

Habr ·

Как сделать интерактивного агента с помощью KV‑кеш‑манипуляций

Обычно LLM работает строго последовательно: получает запрос, рассуждает и только после этого отвечает. Пока она думает, новая информация остаётся за пределами текущего процесса. Пользователь может уточнить вопрос, камера — передать следующий кадр, а инструмент — вернуть результат, но модель не увидит ничего из этого, пока не закончит начатое. Для чат‑бота такая задержка может быть приемлемой. Для голосового ассистента, робота, игрового агента или системы, которая следит за непрерывным видеопотоком, это превращается в фундаментальное ограничение. Интерактивный агент должен получать новые данные прямо во время вычислений, корректировать план без полного перезапуска, выдавать полезные промежуточные действия и координировать процессы, которые идут с разной скоростью: восприятие, рассуждение, речь, работу с инструментами. Меня зовут Георгий Якушев. Я исследователь Yandex Research, преподаватель и выпускник ШАД. Мы изучаем, какую часть этой интерактивности можно реализовать на уровне инференса, не меняя весов уже обученной модели. В этой статье я расскажу, почему полезно перестать воспринимать KV‑кеш только как способ ускорить генерацию и начать рассматривать его как активное состояние агента. Читать далее

Обычно LLM работает строго последовательно: получает запрос, рассуждает и только после этого отвечает. Пока она думает, новая информация остаётся за пределами текущего процесса. Пользователь может уточнить вопрос, камера — передать следующий кадр, а инструмент — вернуть результат, но модель не увидит ничего из этого, пока не закончит начатое. Для чат‑бота такая задержка может быть приемлемой. Для голосового ассистента, робота, игрового агента или системы, которая следит за непрерывным видеопотоком, это превращается в фундаментальное ограничение. Интерактивный агент должен получать новые данные прямо во время вычислений, корректировать план без полного перезапуска, выдавать полезные промежуточные действия и координировать процессы, которые идут с разной скоростью: восприятие, рассуждение, речь, работу с инструментами. Меня зовут Георгий Якушев. Я исследователь Yandex Research, преподаватель и выпускник ШАД. Мы изучаем, какую часть этой интерактивности можно реализовать на уровне инференса, не меняя весов уже обученной модели. В этой статье я расскажу, почему полезно перестать воспринимать KV‑кеш только как способ ускорить генерацию и начать рассматривать его как активное состояние агента. Читать далее

Источник: Habr