中文

面向证据对齐时机与透明决策的渐进式在线视频理解

计算机视觉与模式识别 2026-04-21 v1 人工智能

摘要

在野外运行的视觉智能体必须在视频流中首次出现足够证据时作出响应,这一关键能力被常规在线评估的视频LLM所忽视。向在线、流式范式的转变带来了显著挑战:缺乏决策透明度、对齐响应时机与视觉证据的困难,以及在紧张计算预算下维持全局、因果一致的理解。为此,我们提出一种解耦推理控制与记忆集成的新框架。我们引入\textbf{\model{} },该框架包含两个核心组件。首先,主动思考决策制定器(Active Thinking Decision Maker, ATDM)是一个透明的推理控制器,使用可观测的进度(ρ\boldsymbol{\rho})和置信度(c\boldsymbol{c})指标外部化其决策过程。这使其能够精确地将响应时刻trt_r与首个充分证据时间戳tt^\star对齐,同时向用户流式传输其推理过程。其次,层次化渐进式语义集成模块(Hierarchical Progressive Semantic Integration, HPSI)充当高效记忆系统。它采用一组可学习的、多层级聚合记号跨剪辑传播,以在不超过token预算的前提下构建丰富的全局认知状态。我们的做法在关键在线视频理解基准测试中取得了新的最佳成绩,在StreamingBench上实现了\textbf{71.6\%},在OVOBench上实现了\textbf{46.9\%},为证据对齐和透明的在线视频分析提供了稳健的解决方案。广泛的实验表明,ATDM和HPSI的有效性,例如Thinking-QwenVL在StreamingBench基准测试上的准确率从67.63\%提升到71.60\%。

关键词

引用

@article{arxiv.2604.18459,
  title  = {Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions},
  author = {Kecheng Zhang and Zongxin Yang and Mingfei Han and Haihong Hao and Yunzhi Zhuge and Changlin Li and Junhan Zhao and Zhihui Li and Xiaojun Chang},
  journal= {arXiv preprint arXiv:2604.18459},
  year   = {2026}
}