忽略什么、反应什么:面向视觉鲁棒性的 VLA 模型强化学习精调
机器人学
2026-05-14 v1
摘要
强化学习(RL)精调在机器人操作中的视觉语言动作(VLA)模型中展现出前景,但部署时的视觉变化仍构成实际挑战。一个关键难点在于,标准任务奖励监督任务成功,但对视觉变化是任务无关还是改变操作行为的要求提供有限的指导。我们提出了 PAIR-VLA(Paired Action Invariance & Sensitivity for Visually Robust VLA),一种解决这一难题的 RL 精调框架,通过在 PPO 优化期间对配对视觉变体添加两个辅助目标:一个不变性项减少任务保留型配对(例如不同干扰项)下动作分布的差异,一个灵敏度目标鼓励任务改变型配对(例如目标物体姿态不同)下可分离的动作分布。就这两个目标而言,这些目标将视觉变体从单纯的观察多样性转化为行为层面的指导,以引导 RL 精调期间的策略响应。我们在ManiSkill3上评估了两种代表性 VLA 架构,OpenVLA 和 ,在包括未见干扰项、纹理变化、目标物体姿态变化、视点位移和光照变化等多样化的分布外视觉变化下。我们的方法在标准 PPO 上 consistently 获得改进,在 上实现 16.62% 的平均提升,在 OpenVLA 上实现 9.10% 的提升。值得注意的是,消融实验进一步表明跨视觉变化的泛化性:来自干扰项和纹理变体学习到的不变性指导可迁移到目标姿态和光照变化,而在目标姿态变体上添加灵敏度指导进一步提高对干扰性变化的鲁棒性,凸显了行为层面 RL 指导的更广泛可迁移性。
引用
@article{arxiv.2605.13105,
title = {What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models},
author = {Yuanfang Peng and Jingjing Fu and Chuheng Zhang and Li Zhao and Jiang Bian and Mingyu Liu and Ling Zhang and Jun Zhang and Rui Wang},
journal= {arXiv preprint arXiv:2605.13105},
year = {2026}
}