ParaVT:用于代理视频强化学习的平行工具使用的工具先验悖论的驯服
摘要
通过强化学习 (RL) 训练大型多模态模型 (LMM) 以原生调用视频处理工具(例如裁剪)已成为实现长视频理解的有前景的路径。然而,现有的原生 RL 方法逐轮调度工具调用(即每轮一个):单个错误的裁剪会在无同伴纠错的情况下传播错误,多轮工具调用会损坏上下文,推理成本随轮数线性增长。我们引入 ParaVT,首个针对平行视频工具调用的多智能体 end-to-end RL 训练框架,单轮调度多个时间窗口裁剪以获得更干净的上下文和更好的容错能力。然而,将标准 RL 应用于 ParaVT 暴露了一个我们称之为工具先验悖论的障碍:使能工具探索的预训练工具先验也会 destabilize 冷启动的结构格式,暴露 skip-tool reward shortcut 在温度采样下。对较弱先验 LMM 的交叉模型对比支持了这一主张:格式保持稳定但 RL 仅产生零工具调用,表明先验强度是格式坍塌和工具探索的共同驱动因素。我们提出 PARA-GRPO (Parseability-Anchored and Ratio-gAted GRPO),该方法通过两种互补机制增强标准 RL:(1) 仅在最易坍塌的结构 token 位置应用目标格式奖励;(ii) 每个 prompt 的 frame-budget 随机化,创建调用工具可产生可衡量奖励信号的训练提示。跨六个长视频理解基准,ParaVT 在 Qwen3-VL baseline 上平均提升 7.9%,PARA-GRPO 将训练时格式合规性从 0.13 提升到 0.64。随着工具能力在现代 LMM 中日益内在化,RL 必须与所产生的先验合作,而 ParaVT 为 agentic RL 提供了一条通用配方。代码、数据和模型权重均公开可用。
关键词
引用
@article{arxiv.2605.20342,
title = {ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning},
author = {Zuhao Yang and Kaichen Zhang and Sudong Wang and Keming Wu and Zhongyu Yang and Bo Li and Xiaojuan Qi and Shijian Lu and Xingxuan Li and Lidong Bing},
journal= {arXiv preprint arXiv:2605.20342},
year = {2026}
}
备注
Project Page: https://evolvinglmms-lab.github.io/ParaVT/