中文

ReinFlow:基于在线强化学习的流匹配策略微调

机器人学 2026-01-09 v7 机器学习

摘要

我们提出了ReinFlow,一个简单而有效的在线强化学习(RL)框架,用于微调一系列面向连续机器人控制的流匹配策略。ReinFlow源自严格的RL理论,将可学习的噪声注入流策略的确定性路径中,将流转换为离散时间马尔可夫过程,以进行精确且直接的似然计算。这种转换促进了探索并确保了训练稳定性,使ReinFlow能够微调多种流模型变体,包括Rectified Flow [35]和Shortcut Models [19],特别是在极少甚至只有一个去噪步骤的情况下。我们在代表性的运动和操作任务中对ReinFlow进行了基准测试,包括带有视觉输入和稀疏奖励的长时程规划。在具有挑战性的足式运动任务中经过微调后,Rectified Flow策略的回合奖励获得了135.36%的平均净增长,同时与最先进的扩散RL微调方法DPPO [43]相比,节省了去噪步骤和82.63%的挂钟时间。在状态和视觉操作任务中,使用ReinFlow在四个甚至一个去噪步骤下进行微调后,Shortcut Model策略的成功率获得了40.34%的平均净增长,其性能可与微调后的DDIM策略相媲美,同时平均节省了23.20%的计算时间。项目网页:https://reinflow.github.io/

关键词

引用

@article{arxiv.2505.22094,
  title  = {ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning},
  author = {Tonghe Zhang and Chao Yu and Sichang Su and Yu Wang},
  journal= {arXiv preprint arXiv:2505.22094},
  year   = {2026}
}

备注

38 pages