Proact-VL:面向实时 AI 伴侣的主动式视频语言模型
计算机视觉与模式识别
2026-05-26 v3
摘要
主动且实时的交互体验是人类化 AI 伴侣的必需品,但面临三个关键挑战:(1) 在持续的流式输入下实现低延迟推理,(2) 自主决定何时作出回应,(3) 控制生成内容的质量和数量以满足实时约束。本文通过两种游戏场景(评论员和向导)实例化 AI 伴侣,这两种场景适合自动评估。我们引入了 Live Gaming Benchmark 数据集,包含三个典型场景:独立解说、联合解说和用户引导,并提出 Proact-VL 框架,将多模态语言模型塑造成具备人类化环境感知和交互能力的主动实时交互智能体。大量实验表明,Proact-VL 在保持强视频理解能力的同时,实现了优异的响应延迟和质量,展示了其在实时交互应用中的实用性。
引用
@article{arxiv.2603.03447,
title = {Proact-VL: A Proactive VideoLLM for Real-Time AI Companions},
author = {Weicai Yan and Yuhong Dai and Qi Ran and Haodong Li and Wang Lin and Tao Jin and Xing Xie and Hao Liao and Jianxun Lian},
journal= {arXiv preprint arXiv:2603.03447},
year = {2026}
}
备注
ICML 2026