中文

感知、验证与理解长视频:基于交互式智能体的多粒度感知与主动验证

计算机视觉与模式识别 2026-05-07 v2

摘要

长视频具有时间复杂度高和任务相关信息稀疏的特点,对 AI 系统构成了重大的推理挑战。尽管现有的基于大型语言模型(LLM)的方法在长视频理解方面取得了进展,但仍受限于与任务无关的固定粒度感知流程,并存在视觉语言幻觉问题。受人类自适应感知和主动验证的启发,我们提出了 CogniGPT,这是一个利用多粒度感知智能体(MPA)与主动验证智能体(AVA)之间交互循环的框架。具体而言,MPA 不依赖预定的启发式规则,而是根据不断演变的上下文自适应地确定最佳感知粒度和策略;同时,AVA 主动挖掘多视角视觉证据,以交叉验证关键观察结果并消除幻觉。这种交互使 CogniGPT 能够高效地识别出一组最小且可靠的任务相关线索。在 EgoSchema、Video-MME、NExT-QA 和 MovieChat 上的大量实验证明了其在准确性和效率方面的优越性。值得注意的是,在 EgoSchema 上,它仅使用 11.2 帧就超越了现有的免训练方法,并取得了与 Gemini 1.5-Pro 相当的性能。

关键词

引用

@article{arxiv.2509.24943,
  title  = {Perceive, Verify and Understand Long Video: Multi-Granular Perception and Active Verification via Interactive Agents},
  author = {Jiahua Li and Zhanhe Zhang and Chenghao Xu and Zhe Xu and Kun Wei and Xu Yang and Cheng Deng},
  journal= {arXiv preprint arXiv:2509.24943},
  year   = {2026}
}