中文

主动视频感知:用于智能长视频理解的迭代证据寻求

计算机视觉与模式识别 2025-12-08 v1 人工智能 计算与语言

摘要

长视频理解(LVU)具有挑战性,因为现实世界查询往往依赖于隐藏在数小时冗余无关内容中的稀疏、时序分散的线索。虽然agentic管道可以提高视频推理能力,但现行框架依赖于查询不可知的captioner来感知视频信息,这会在无关内容上浪费计算资源,并模糊细粒度的时间和空间信息。受主动感知理论启发,我们认为LVU智能体应主动决定观察什么、何时观察以及何地观察,并持续评估当前观察是否足以回答查询。我们提出了主动视频感知(Active Video Perception, AVP)框架,将视频视为交互式环境,直接从像素获取紧凑、与查询相关的证据。具体而言,AVP以MLLM智能体运行迭代计划-观察-反思过程。在每一轮中,规划器提出针对性的视频交互,观察者执行这些交互以提取带时间戳的证据,反思者评估证据是否足以回答查询,若足够则输出答案,否则触发进一步观察。在五个LVU基准测试中,AVP实现了最高性能,显著提升。值得注意的是,AVP在平均准确率上比最佳agentic方法提高了5.7%,仅需18.4%的推理时间和12.4%的输入token。

关键词

引用

@article{arxiv.2512.05774,
  title  = {Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding},
  author = {Ziyang Wang and Honglu Zhou and Shijie Wang and Junnan Li and Caiming Xiong and Silvio Savarese and Mohit Bansal and Michael S. Ryoo and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:2512.05774},
  year   = {2025}
}

备注

Website: https://activevideoperception.github.io/