中文

CAViAR: 评论家增强的视频智能体推理

计算机视觉与模式识别 2025-09-10 v1 机器学习

摘要

近年来,视频理解取得了显著进展,模型对短视频片段的感知性能持续提升。然而,多个近期的基准测试(如 LVBench、Neptune 和 ActivityNet-RTL)表明,随着查询变得更加复杂和视频变得更长,模型在需要复杂推理的任务上的性能会下降。在这项工作中,我们提出一个问题:能否利用现有的感知能力来成功执行更复杂的视频推理?具体来说,我们开发了一个大型语言模型智能体,该智能体可以访问视频模块作为子智能体或工具。与以往工作(如 Visual Programming、ViperGPT 和 MoReVQA)中遵循固定程序来解决查询不同,该智能体利用每次调用模块的结果来决定后续步骤。受文本推理领域工作的启发,我们引入了一个评论家来区分智能体成功与不成功的序列实例。我们表明,我们的智能体与评论家的结合在之前提到的数据集上取得了强大的性能。

关键词

引用

@article{arxiv.2509.07680,
  title  = {CAViAR: Critic-Augmented Video Agentic Reasoning},
  author = {Sachit Menon and Ahmet Iscen and Arsha Nagrani and Tobias Weyand and Carl Vondrick and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2509.07680},
  year   = {2025}
}