中文

Weaver: 面向视频交错推理的端到端智能体系统训练

计算机视觉与模式识别 2026-02-06 v1

摘要

视频推理构成模型能力的全面评估,因其要求强大的感知与解读能力,成为探索模型性能边界的手段。虽然近期研究利用文本导向的链式思维(Chain-of-Thought)增强这些能力,但此类方法常因表征不匹配且感知精度受限而受限。为此,我们提出Weaver,一种新型端到端可训练的多模态推理智能体系统。Weaver使其策略模型能够在推理过程中动态调用多样工具,实现关键视觉线索的渐进获取与真实多模态推理轨迹的构建。进而,我们集成强化学习算法,使系统能自由探索运用和组合这些工具的策略。大量实验表明,我们的系统Weaver在多个复杂视频推理基准上提升性能,尤其是涉及长视频的任务。

关键词

引用

@article{arxiv.2602.05829,
  title  = {Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning},
  author = {Yudi Shi and Shangzhe Di and Qirui Chen and Qinian Wang and Jiayin Cai and Xiaolong Jiang and Yao Hu and Weidi Xie},
  journal= {arXiv preprint arXiv:2602.05829},
  year   = {2026}
}