中文

VideoTemp-o3:在代理思考视频中统一建模时序定位与视频理解

计算机视觉与模式识别 2026-05-25 v4 人工智能

摘要

在长视频理解中,传统的均匀帧采样往往难以捕获关键视觉证据,导致性能下降和 hallucinations 增加。为此,近期涌现出基于代理思考视频的范式,采用本地化-采样-回答管道,模型主动识别相关视频片段,在这些片段中进行密集采样,然后生成答案。然而,现有方法仍不够高效,局化能力较弱,且遵循僵化的工作流程。为解决这些问题,我们提出 VideoTemp-o3,一个统一的代理思考视频框架,联合建模视频定位与问答。VideoTemp-o3 具备强大的局化能力,支持按需裁剪,并可细化不准确的局化。具体而言,在监督微调阶段,我们设计了统一的掩码机制,以鼓励探索同时防止噪声。在强化学习方面,我们引入专门奖励以缓解奖励黑客。此外,从数据角度,我们构建了高质量长视频定位问答数据的有效管道,并开发了相应基准,进行系统评估。实验结果表明,我们的方法在长视频理解和定位方面均取得卓越性能。

关键词

引用

@article{arxiv.2602.07801,
  title  = {VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos},
  author = {Wenqi Liu and Yunxiao Wang and Shijie Ma and Meng Liu and Qile Su and Tianke Zhang and Haonan Fan and Changyi Liu and Kaiyu Jiang and Jiankang Chen and Kaiyu Tang and Bin Wen and Fan Yang and Tingting Gao and Han Li and Yinwei Wei and Xuemeng Song},
  journal= {arXiv preprint arXiv:2602.07801},
  year   = {2026}
}

备注

ICML 2026