Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking
机器学习
2026-05-18 v1 机器人学
摘要
强化学习(RL)允许视觉语言动作(VLA)策略在训练分布之外通过直接优化任务成功来实现泛化,但后训练计算成本高昂。自然的响应是通过更快的模拟器和世界模型来加快 rollout收集。在GRPO-based VLA RL中,我们发现主导成本并非如此:在我们的运行中,梯度计算占垂直时间的约78%,而rollout收集仅为21%。梯度成本主导是因为这部分计算花在贡献有限于学习的阶段上。GRPO的学习信号由优势方差驱动:只有成功和失败的rollout在此处发生分歧的阶段才会产生学习信号。然而,GRPO为每个rollout中的每个chunk分配相同的优势。结果是,actor-update计算在整个轨迹上均匀分布,包括预训练和监督微调后策略已经处理的阶段。本文提出了概率块遮蔽(PCM),这是一种对GRPO的即插即用修改,將梯度计算分配给每个轨迹中被概率选定的少数几个chunk。PCM使用成功-失败动作方差对语义阶段进行评分,这是一种从rollout派生的每阶段梯度方差的proxy,并通过在线更新的阶段级别保留概率,对固定的chunk预算进行采样。我们将每阶段梯度方差形式化为确定梯度计算何处有用的量,并展示成功-失败动作方差提供了可测量的proxy。PCM无需奖励模型或学习型批评家。在三个LIBERO基准上,PCM在保持最终成功率与标准GRPO相当的同时,实现了2.38倍的垂直时间加速、4.8倍的梯度更新速度以及60%的峰值激活内存降低,同时只对少于20%的轨迹chunk进行反向传播。
引用
@article{arxiv.2605.16154,
title = {Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking},
author = {Vaidehi Bagaria and Nikshep Grampurohit and Pulkit Verma},
journal= {arXiv preprint arXiv:2605.16154},
year = {2026}
}