中文

VideoPro:用于长视频理解的自适应程序推理

计算机视觉与模式识别 2026-01-27 v4

摘要

大型语言模型 (LLM) 在生成用于视觉任务的程序工作流程方面显示出前景。然而,之前的方法往往依赖于闭源模型,缺乏系统化的推理,且在处理长篇视频问答 (videoQA) 时面临挑战。为此,我们引入了 FS-VisPR 框架,这是一种自适应的视觉程序推理方法,平衡了简单查询的快速推理与复杂查询的慢速推理。首先,我们设计了高效的视觉模块(例如关键片段检索和字幕检索)以支持长视频任务。随后,我们构建了一个多样且高质量的快速-慢速推理数据集,利用强大的 LLM 对齐开源语言模型的能力,使其能够生成视觉程序工作流程作为 FS-LLM。接着,我们设计了快速-慢速推理框架:简单查询直接由 VideoLLM 解决,而复杂查询则调用视觉程序推理,这是受人类类推理过程的启发。在此过程中,对低置信度的快速思考答案会触发第二阶段的慢速推理过程,如果程序执行失败,则激活对快速推理的回退机制。此外,我们通过训练和推理期间的参数搜索改进视觉程序。在训练期间,挑选产生正确答案的程序;在推理期间,应用置信度最高的结果对应的程序。实验表明,FS-VisPR 在视觉程序工作流程方面提高了了效率和可靠性。它在 LVBench 上的准确率达到 50.4%,超越了 GPT-4o,与 Qwen2.5VL-72B 在 VideoMME 上的表现持平。

关键词

引用

@article{arxiv.2509.17743,
  title  = {VideoPro: Adaptive Program Reasoning for Long Video Understanding},
  author = {Chenglin Li and Feng Han and Yikun Wang and Ruilin Li and Shuai Dong and Haowen Hou and Haitao Li and Qianglong Chen and Feng Tao and Jingqi Tong and Yin Zhang and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2509.17743},
  year   = {2026}
}