中文

面向长视频理解的不确定性感知链式思维增强 LLM 代理系统

计算机视觉与模式识别 2025-04-08 v1

摘要

长视频理解在计算机视觉中日益重要且具有挑战性。代理方法因能够处理长序列并整合各种工具来捕获细粒度信息而日益流行。然而,现有方法仍面临几个挑战:(1) 仅依赖大型语言模型(LLM)的推理能力,而缺乏针对长视频场景的专门推理机制;(2) 仍然容易受到外部工具错误或噪声的影响。为此,我们提出了一种专为长视频分析设计的链式思维(CoT)过程。我们提出的带有计划调整模式的 CoT 使 LLM 能够逐步规划并调整信息获取策略。进一步,我们融合了来自 LLM 和外部工具的启发式不确定性估计,以指导 CoT 过程。这使 LLM 能够评估新收集信息的可靠性,细化收集策略,在综合最终答案时作出更稳健的决策。实证实验表明,我们的不确定性感知 CoT 有效缓解了外部工具的噪声,产生更可靠的输出。我们将方法实现于一个名为 VideoAgent2 的系统中,还包括通用上下文获取和专用工具设计等额外模块。在三个专门的长视频基准测试(及其子集)上的评估显示,VideoAgent2 在性能上优于之前的最先进基于代理的方法 VideoAgent,平均提升 13.1%,并在所有零样本方法中实现领先性能。

关键词

引用

@article{arxiv.2504.04471,
  title  = {VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT},
  author = {Zhuo Zhi and Qiangqiang Wu and Minghe shen and Wenbo Li and Yinchuan Li and Kun Shao and Kaiwen Zhou},
  journal= {arXiv preprint arXiv:2504.04471},
  year   = {2025}
}