中文

AgentCVR:基于脚本模拟强化学习的主动多智能体跨视频推理

计算机视觉与模式识别 2026-05-29 v1 多智能体系统

摘要

跨视频推理(CVR)已成为多模态智能的关键前沿,要求模型检索、对齐和聚合分布在多个视频中的证据。当前的多模态大语言模型(MLLM)在 CVR 上常因简单单遍策略而难以处理——这些策略将多个视频编码为共享的压缩上下文,可能模糊化罕见但关键的证据。本文提出了 AgentCVR,一种将 CVR 视为主动证据获取任务的多智能体框架。AgentCVR 采用主导智能体(Master Agent)协调专门的视觉与音频智能体,以针对性地提取证据。为确保高效训练,我们引入 Script-Simulated RL,通过 LLM 生成的语义脚本和轻量级文本模拟器进行策略优化,绕过在在线探索中进行高成本的多模态推理。实验在全面 CVR 基准测试上表明,AgentCVR 优于单遍基线方法,在复杂跨视频对齐和定位方面性能与最先进的闭源系统相当。为确保可重复性,我们的代码已公开于 https://github.com/wang-jh24/AgentCVR。

关键词

引用

@article{arxiv.2605.29643,
  title  = {AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning},
  author = {Yilun Qiu and Jiahe Wang and Cilin Yan and Jiayin Cai and Xiaolong Jiang and Yao Hu and Chun Yuan},
  journal= {arXiv preprint arXiv:2605.29643},
  year   = {2026}
}