VADE:基于在线样本难度估计的方差感知动态抽样用于多模态强化学习
机器学习
2025-11-25 v1 人工智能
摘要
基于组的策略优化方法如 GRPO 和 GSPO 已成为训练多模态模型的标准做法,利用组内滚动和相对优势估计。然而,它们 suffer 从组内所有响应获得相同奖励导致的梯度消失问题,使得优势估计崩溃,训练信号减弱。现有的缓解措施分为两大范式:过滤式和抽样式方法。过滤式方法首先广泛生成滚动,然后消除无信息的组,导致计算开销巨大;抽样式方法则在滚动之前主动选择有效样本,但依赖于静态准则或先前数据集知识,缺乏实时适应性。为此,我们提出了 \textbf{VADE},即通过在线样本难度估计实现的方差感知动态抽样框架。我们的框架集成了三个关键组件:使用 Beta 分布进行在线样本难度估计、通过估计的正确概率最大化信息增益的 Thompson 抽样器,以及维持在策略演化下的鲁棒估计的双尺度先验衰减机制。该三组件设计使 VADE 能够动态选择最具信息性的样本,从而放大训练信号,同时消除额外的滚动成本。大量实验表明,VADE 在多模态推理基准测试中在性能和样本效率方面 consistently 优于强大基线,同时显著降低计算开销。更重要的是,我们的框架可作为可无缝集成到现有基于组的 RL 算法中的即插即用组件。代码和模型已在 https://VADE-RL.github.io 提供。
引用
@article{arxiv.2511.18902,
title = {VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL},
author = {Zengjie Hu and Jiantao Qiu and Tianyi Bai and Haojin Yang and Binhang Yuan and Qi Jing and Conghui He and Wentao Zhang},
journal= {arXiv preprint arXiv:2511.18902},
year = {2025}
}