DyGRO-VLA:基于动态分组残差优化的跨任务视觉语言动作模型扩展
机器人学
2026-05-19 v1 机器学习
摘要
近期进展在强化学习(RL)为优化视觉语言动作(VLA)模型提供了原则方法,促进了从轨迹模仿向任务环境中主动学习的转变。尽管控制精度有所提高,大多数RL优化器仍限于特定任务,导致VLA模型从通用控制器退化为仅针对狭窄任务集合的策略。本研究对此现象进行深入分析,突出跨任务特征表示对提高VLA模型通用性的重要性。基于此发现,我们引入DyGRO-VLA,一个两阶段优化框架:1)基于信息论原理有效捕获跨任务潜在表示;2)通过混合RL残差动态细化策略优化。DyGRO-VLA使RL优化器能够利用任务相关潜在信息,同时在优化过程中战略性地减轻对已学习表示的负面干扰。我们在LIBERO、RoboTwin2基准测试上评估了该方法,并在真实世界环境中进一步验证,证明在多任务训练和分布迁移下相对于强大基线 consistently 获得改进。
引用
@article{arxiv.2605.17486,
title = {DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization},
author = {Sixu Lin and Yunpeng Qing and Litao Liu and Ming Zhou and Ruixing Jin and Xiaoyi Fan and Guiliang Liu},
journal= {arXiv preprint arXiv:2605.17486},
year = {2026}
}