TGRPO:基于轨迹级分组相对策略优化的视觉语言动作模型精调
机器人学
2025-09-30 v3 人工智能
摘要
视觉语言动作(Visual-Language-Action, VLA)模型通过大规模预训练和任务特定精调,在各种机器人任务中展现出强大的跨情境泛化能力。然而,其训练范式主要依赖手动收集的成功演示,使得其在遇到非分布(Out-of-Distribution, OOD)情境或执行偏差时难以适应。尽管强化学习(Reinforcement Learning, RL)通过主动试错机制提供闭环优化框架,但在长期机器人任务中 suffers from稀疏奖励、高方差和不稳定优化。为此,我们提出了基于轨迹的分组相对策略优化(Trajectory-based Group Relative Policy Optimization, TGRPO),一种用于VLA模型的在线RL训练框架。TGRPO利用来自大语言模型的任务分析自动构建稠密奖励函数,为加速收敛和改进信用分配提供细粒度反馈。我们的方法核心是一种基于分组的策略,用于并行采样和规范化多个轨迹,通过相对比较降低方差。通过整合轨迹级和步骤级优势估计,TGRPO在不依赖价值网络的情况下捕获全局和局部优化信号。在LIBERO基准测试的四个任务类别实验中,TGRPO实现了80.7%的平均成功率,这比监督精调(Supervised Fine-Tuning, SFT)高出4.2%,并优于其他代表性RL后训练方法。
引用
@article{arxiv.2506.08440,
title = {TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization},
author = {Zengjue Chen and Runliang Niu and He Kong and Qi Wang and Qianli Xing and Zipei Fan},
journal= {arXiv preprint arXiv:2506.08440},
year = {2025}
}