中文

Dispider:通过解耦感知、决策与反应实现视频 LLM 的主动实时交互

计算机视觉与模式识别 2025-01-07 v1

摘要

与视频 LLM 进行主动实时交互引入了人机交互的新范式,模型不仅要理解用户意图,还需在持续处理流式视频的同时即时作出响应。不同于离线视频 LLM 在作答前分析整个视频,主动实时交互需要三个能力:1)感知:实时视频监控与交互捕获;2)决策:在恰当时机主动触发交互;3)反应:与用户持续交互。然而,这些期望能力之间存在内在冲突。决策与反应需要不同的感知尺度与粒度,而自回归解码又会阻塞实时感知与决策。为在和谐系统中统一这些冲突能力,我们提出了 Dispider——一种解耦感知、决策与反应的系统。Dispider 具备轻量级的主动流式视频处理模块,用于跟踪视频流并识别最佳交互时机。一旦触发交互,异步交互模块即提供详细响应,而处理模块可继续监控视频。我们的解耦式异步设计确保了及时、情境准确且计算高效的响应,使其成为长时段视频流的主动实时交互的理想选择。实验表明,Dispider 不仅在传统视频问答任务中保持强性能力,还在流式场景响应方面显著超越了之前的在线模型,从而验证了该架构的有效性。代码与模型已发布于 \url{https://github.com/Mark12Ding/Dispider}。

关键词

引用

@article{arxiv.2501.03218,
  title  = {Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction},
  author = {Rui Qian and Shuangrui Ding and Xiaoyi Dong and Pan Zhang and Yuhang Zang and Yuhang Cao and Dahua Lin and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2501.03218},
  year   = {2025}
}