中文

VideoChat-M1:通过多智能体强化学习实现视频理解的协作策略规划

计算机视觉与模式识别 2026-03-05 v2 多智能体系统

摘要

通过利用工具增强的多模态大语言模型(MLLMs),多智能体框架正在推动视频理解的进展。然而,大多数框架采用静态且不可学习的工具调用机制,这限制了发现对鲁棒感知和推理时序或空间复杂视频至关重要的多样线索。为应对这一挑战,我们提出了一种用于视频理解的多智能体系统,即VideoChat-M1。与其使用单一或固定策略,VideoChat-M1采用一种独特的协作策略规划(CPP)范式,包含多个策略智能体,涵盖三个关键过程。(1)策略生成:每个智能体根据用户查询生成其独特的工具调用策略;(2)策略执行:每个智能体依次调用相关工具来执行其策略并探索视频内容;(3)策略通信:在策略执行的中间阶段,智能体之间相互交互以更新各自的策略。通过这一协作框架,所有智能体协同工作,根据来自同侪的上下文洞察动态优化其首选策略,从而有效响应用户查询。此外,我们为CPP范式配备了一种简洁的多智能体强化学习(MARL)方法。因此,策略智能体团队可以在最终答案奖励和中间协作过程反馈的引导下联合优化,以提升VideoChat-M1的性能。大量实验表明,VideoChat-M1在涵盖四个任务的八个基准测试上取得了最先进性能。特别地,在LongVideoBench上,我们的方法比最先进模型Gemini 2.5 pro高出3.6%,比GPT-4o高出15.6%。

关键词

引用

@article{arxiv.2511.19524,
  title  = {VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning},
  author = {Boyu Chen and Zikang Wang and Zhengrong Yue and Kainan Yan and Chenyun Yu and Yi Huang and Zijun Liu and Yafei Wen and Xiaoxin Chen and Yang Liu and Peng Li and Yali Wang},
  journal= {arXiv preprint arXiv:2511.19524},
  year   = {2026}
}

备注

Accepted by CVPR 2026