中文

OGPO:生成式控制策略的高效全参数微调

机器学习 2026-05-06 v1 机器人学

摘要

生成式控制策略(GCPs),如扩散模型和流模型控制策略,已成为机器人学习中有效的参数化方法。本工作引入Off-policy Generative Policy Optimization (OGPO),一种用于微调GCPs的高效采样算法,maintains off-policy critic networks以最大化数据重用,并通过修改PPO目标使用critic作为终端奖励,将策略梯度通过策略整个生成过程传播。OGPO在操作任务上实现了最佳性能,涵盖多任务场景、高精度插入和灵巧控制。对我们而言,它也是唯一能够使用几乎没有专家数据即可将差ly初始化的行为克隆策略微调到接近完整任务成功的方法,并且只需极少的任务特定超参数调优。通过大量实证研究,我们展示OGPO在策略引导和学习残差纠正方面显著优于其他方法,确定了其性能背后的关键机制。我们进一步引入实用稳定器,包括成功缓冲正则化、保守优势、χ2\chi^2正则化和Q方差降低,以缓解在状态和像素基础设置下的critic过度利用问题。除了提出OGPO,我们进行了GCP微调的系统实证研究,确定支配成功离-policy改进的稳定机制和失效模式。

关键词

引用

@article{arxiv.2605.03065,
  title  = {OGPO: Sample Efficient Full-Finetuning of Generative Control Policies},
  author = {Sarvesh Patil and Mitsuhiko Nakamoto and Manan Agarwal and Shashwat Saxena and Jesse Zhang and Giri Anantharaman and Cleah Winston and Chaoyi Pan and Douglas Chen and Nai-Chieh Huang and Zeynep Temel and Oliver Kroemer and Sergey Levine and Abhishek Gupta and Hongkai Da and Paarth Shah and Max Simchowitz},
  journal= {arXiv preprint arXiv:2605.03065},
  year   = {2026}
}