VideoExplorer:用于智能体式长视频理解的“以视频思考”框架
计算机视觉与模式识别
2025-11-04 v6 人工智能
计算与语言
摘要
长视频理解(LVU)是计算机视觉中的一个具有挑战性的问题。现有方法要么通过降采样帧数进行单遍推理,牺牲细粒度细节,要么依赖于针对任务无关表示的文本推理,阻碍了任务特定的感知与探索。本文提出了VideoExplorer框架,基于“以视频思考”的原则,将规划、时间锚定和可扩展感知自然地融入连贯的推理过程中。不同于对静态上下文进行推理,VideoExplorer会迭代地构建子问题、定位相关时段,并执行面向任务的、可扩展的时间视频理解,直至得出最终答案,从而实现可靠、高效且可解释的推理。为解决缺乏长视频理解训练资源的问题,本文采用难度自适应抽样构建了长视频推理数据集,以确保复杂任务下的高质量轨迹。基于该数据集,我们设计了两阶段训练流程:监督轨迹初始化 followed by 轨迹级偏好优化,引导自下游奖励的自适应时间锚定和迭代信息整合。在众多流行的长视频理解与推理基准测试上的广泛评估表明,VideoExplorer相比现有基线具有显著优势,展现出其鲁棒性、适应性和效率。我们的代码已在本仓库(https://github.com/yhy-2000/VideoDeepResearch)公开。
引用
@article{arxiv.2506.10821,
title = {VideoExplorer: Think With Videos For Agentic Long-Video Understanding},
author = {Huaying Yuan and Zheng Liu and Junjie Zhou and Hongjin Qian and Yan Shu and Nicu Sebe and Ji-Rong Wen and Zhicheng Dou},
journal= {arXiv preprint arXiv:2506.10821},
year = {2025}
}