中文

Open-o3-Video: 基于显式时空证据的接地视频推理

计算机视觉与模式识别 2026-03-20 v2 人工智能 多媒体

摘要

大多数视频推理模型仅生成文本推理轨迹,而不指明关键证据出现的时间和位置。最近的模型如OpenAI-o3引发了对于图像中以证据为中心的推理的广泛兴趣,然而将这种能力扩展到视频更具挑战性,因为需要在动态场景中联合进行时间跟踪和空间定位。我们引入了Open-o3-Video,一个非智能体框架,通过高亮关键时间戳、物体和边界框,将显式的时空证据整合到视频推理中,使推理过程可追溯和可验证。为实现此能力,我们首先构建了高质量数据集STGR,该数据集提供了统一的时空监督,这是现有资源中所缺失的。我们进一步采用了一种冷启动强化学习策略,并设计了专门设计的奖励函数,共同鼓励答案准确性、时间对齐和空间精度。在V-STAR基准上,Open-o3-Video取得了最先进的性能,在mAM和mLGM指标上分别比Qwen2.5-VL基线提升了14.4%和24.2%,并在一系列视频理解基准上展现出持续的性能提升。除了准确性之外,Open-o3-Video生成的接地推理轨迹支持置信度感知的测试时缩放,提高了答案的可靠性。

关键词

引用

@article{arxiv.2510.20579,
  title  = {Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence},
  author = {Jiahao Meng and Xiangtai Li and Haochen Wang and Yue Tan and Tao Zhang and Lingdong Kong and Yunhai Tong and Anran Wang and Zhiyang Teng and Yujing Wang and Zhuochen Wang},
  journal= {arXiv preprint arXiv:2510.20579},
  year   = {2026}
}