借助视频进行思考:基于工具增强的多模态强化学习用于长视频推理
计算机视觉与模式识别
2025-09-04 v2
摘要
多模态大语言模型(MLLMs)的视频推理能力对于视频问答和时间锚定等下游任务至关重要。虽然最近的研究探索了基于文本的链式思维(CoT)推理,但这些方法在跨模态交互有限、尤其在较长视频或推理链中容易产生幻觉方面存在挑战。为此,我们提出了一种名为 Video Intelligence via Tool-Augmented Learning(VITAL)的新型端到端智能体视频推理框架。通过视觉工具箱,模型可以按需对新视频帧进行密集抽样,并生成精准的多模态 CoT 以进行长视频推理。我们观察到,时间锚定和问答任务相互促进视频理解。因此,我们构建了两个高质量的多任务视频推理数据集,分别用于监督微调(MTVR-CoT-72k)和强化学习(MTVR-RL-110k)。此外,我们提出了一种难度感知分组相对策略优化算法(DGRPO),以缓解多任务强化学习中的难度不平衡问题。在11个具有挑战性的视频理解基准测试上进行的大量实验表明,VITAL展现出先进的推理能力,在视频问答和时间锚定任务中尤其在长视频场景下超越了现有方法。代码已公开 https://zhang9302002.github.io/thinkingwithvideos-page/。
引用
@article{arxiv.2508.04416,
title = {Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning},
author = {Haoji Zhang and Xin Gu and Jiawen Li and Chixiang Ma and Sule Bai and Chubin Zhang and Bowen Zhang and Zhichao Zhou and Dongliang He and Yansong Tang},
journal= {arXiv preprint arXiv:2508.04416},
year = {2025}
}