中文

面向视觉-语言-动作模型的流匹配策略强化学习微调

机器学习 2025-10-14 v1 机器人学

摘要

视觉-语言-动作(VLA)模型(如 OpenVLA、Octo 和 π0\pi_0)通过利用大规模演示数据展现出了强大的泛化能力,但其性能仍从根本上受限于监督数据的质量和覆盖范围。强化学习(RL)为通过在线交互改进和微调 VLA 提供了一条充满前景的路径。然而,传统的策略梯度方法在基于流匹配的模型背景下计算上不可行,因为重要性采样过程难以处理,需要显式计算策略比率。为克服这一局限,我们提出了流策略优化(FPO)算法,该算法通过利用条件流匹配目标中每个样本的变化来重构重要性采样。此外,FPO 通过集成结构感知信用分配以提升梯度效率、采用裁剪替代目标以稳定优化、引入多步潜在探索以鼓励多样化的策略更新,以及设计 Q 集成机制以提供鲁棒的价值估计,实现了对 π0\pi_0 模型稳定且可扩展的在线强化学习微调。我们在 LIBERO 基准和 ALOHA 仿真任务上,将 FPO 与监督式、偏好对齐、基于扩散、自回归在线 RL 以及 π0\pi_0-FAST 等基线方法进行了对比评估,观察到 FPO 在模仿先验基础上取得了一致的性能提升,并在稀疏奖励下表现出稳定学习,优于其他强基线方法。此外,消融研究及对潜在空间动力学的分析进一步凸显了 FPO 中各独立组件的贡献,验证了所提计算模块的有效性以及在线 RL 过程中条件流匹配目标的稳定收敛性。

关键词

引用

@article{arxiv.2510.09976,
  title  = {Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models},
  author = {Mingyang Lyu and Yinqian Sun and Erliang Lin and Huangrui Li and Ruolin Chen and Feifei Zhao and Yi Zeng},
  journal= {arXiv preprint arXiv:2510.09976},
  year   = {2025}
}