automation

Как сделать интерактивного агента с помощью KV‑кеш‑манипуляций

Обычно LLM работает строго последовательно: получает запрос, рассуждает и только после этого отвечает. Пока она думает, новая информация остаётся за пределами текущего процесса. Пользователь может уточнить вопрос, камера — передать следующий кадр, а инструмент — вернуть результат, но модель не увидит ничего из этого, пока не закончит начатое. Для чат‑бота такая задержка может быть приемлемой. Для голосового ассистента, робота, игрового агента или системы, которая следит за непрерывным видеопотоком, это превращается в фундаментальное ограничение. Интерактивный агент должен получать новые данные прямо во время вычислений, корректировать план без полного перезапуска, выдавать полезные промежуточные действия и координировать процессы, которые идут с разной скоростью: восприятие, рассуждение, речь, работу с инструментами. Меня зовут Георгий Якушев.

Читать далее →