Video-o3:用于长视频多跳推理的原生交错线索寻找
计算机视觉与模式识别
2026-05-22 v2
摘要
现有的多模态大语言模型用于长视频理解主要依赖均匀采样和单轮推理,限制了其在大量冗余信息中识别稀疏关键证据的能力。我们引入 Video-o3,一个支持迭代发现关键视觉线索、精细检查关键片段以及一旦获取足够证据即自适应终止的新框架。技术上,我们解决了交错工具调用中的两个核心挑战。首先,为缓解推理与工具调用异构性导致的注意力分散,我们提出了任务解耦注意力掩码(TASK-Decoupled Attention Masking),该方法在保持共享全局上下文的同时隔离每一步的注意力集中。其次,为控制多轮交互中的上下文长度增长,我们引入了可验证轨迺引导奖励(Verifiable Trajectory-Guided Reward),在探索覆盖性和推理效率之间进行平衡。为支持大规模训练,我们进一步开发了数据合成管道,构建了 Seeker-173K,包含 173K 条高质量工具交互轨迹,用于有效的监督学习和强化学习。广泛的实验表明,Video-o3 在 MLVU 上达到 72.1% 的准确率,在 Video-Holmes 上达到 46.5% 的准确率。这些结果表明 Video-o3 在多跳证据寻找和推理方面具有强大的能力,验证了在长视频场景中原生工具调用的有效性。
引用
@article{arxiv.2601.23224,
title = {Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning},
author = {Xiangyu Zeng and Zhiqiu Zhang and Yuhan Zhu and Xinhao Li and Zikang Wang and Changlian Ma and Qingyu Zhang and Zizheng Huang and Kun Ouyang and Tianxiang Jiang and Ziang Yan and Yi Wang and Hongjie Zhang and Yali Wang and Limin Wang},
journal= {arXiv preprint arXiv:2601.23224},
year = {2026}
}
备注
27 pages, 15 figures, 15 tables