中文

用于在线强化学习的演化扩散与流匹配策略

机器学习 2026-03-10 v2

摘要

扩散和流匹配策略提供了具有表达性和多模态动作建模的能力,但由于不可计算的似然值和通过长采样链的梯度传播,这些方法在在线强化学习(RL)中常常不稳定。相比之下,可计算的参数化如高斯分布缺乏处理复杂控制所需的表达性——这导致优化稳定性与表示能力之间持续的张力。我们通过一种关键结构原则来解决这一张力:将优化与生成解耦。基于此,我们引入GoRL(Generative Online Reinforcement Learning),一个算法无关的框架,通过将策略优化局限于可计算的潜在空间,同时将动作合成委托给条件生成解码器来训练具有表达性的策略。我们采用两时刻交替计划,并以固定先验为锚点来 refining 解码器,GoRL实现了稳定的优化,同时不断扩展表达性。在广泛的连续控制任务上,GoRL consistently优于单模态和生成基线。在具有挑战性的HopperStand任务上,它实现了超过870的回报——是最强基线的3倍以上——展示了一条实际路径,实现既稳定又高度表达的策略。我们的代码已公开于https://github.com/bennidict23/GoRL。

关键词

引用

@article{arxiv.2512.02581,
  title  = {Evolving Diffusion and Flow Matching Policies for Online Reinforcement Learning},
  author = {Chubin Zhang and Zhenglin Wan and Feng Chen and Fuchao Yang and Lang Feng and Yaxin Zhou and Xingrui Yu and Yang You and Ivor Tsang and Bo An},
  journal= {arXiv preprint arXiv:2512.02581},
  year   = {2026}
}

备注

Ver 2