中文

边看边说:释放多模态大语言模型的真正实时视频理解能力

计算机视觉与模式识别 2026-01-13 v1 计算与语言

摘要

多模态大语言模型(MLLMs)在众多任务上取得了强大的性能,但大多数系统仍受限于离线推理,需在生成输出前完成全部输入。近期的流式方法通过交错感知和生成来降低延迟,但仍强制执行感知-生成的顺序循环,限制了实时交互。在本工作中,我们针对将 MLLMs 扩展到实时视频理解的根本瓶颈:标准位置编码方案所施加的全局位置连续性约束。虽然在离线推理中自然,但这种约束紧密耦合感知与生成,阻止有效的输入输出并行。为解决此限制,我们提出一种并行流式框架,通过三种设计放松位置连续性:重叠、群分离和间隔隔离。这些设计使感知和生成能够同时进行,使模型在实时生成响应的同时处理输入。大量实验表明,群分离设计在效率与性能之间取得最佳平衡,保持高流畅度和准确性,同时显著降低延迟。我们进一步表明,所提框架在感知-生成负载平衡下可实现最高 2 倍加速,为建立从容、实时的“边说边看”系统系统提供了原则性路径。我们将所有代码公开于:https://github.com/EIT-NLP/Speak-While-Watching。

关键词

引用

@article{arxiv.2601.06843,
  title  = {Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models},
  author = {Junyan Lin and Junlong Tong and Hao Wu and Jialiang Zhang and Jinming Liu and Xin Jin and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2601.06843},
  year   = {2026}
}