中文

基于流的单步完成:高效且表征多样的策略学习

机器学习 2026-02-26 v3 机器人学

摘要

扩散模型和流匹配模型能够捕捉丰富且多模态的动作分布,为离线强化学习提供了具有表达力的策略,但其迭代抽样引入了高昂的推理成本,且由于跨抽样步骤的梯度传播,训练过程不稳定。我们提出了单步完成策略(Single-Step Completion Policy, SSCP),通过增强的流匹配目标训练,预测从中间流样本直接生成完成向量,从而实现准确的单次动作生成。在离线演员-评论家框架中,SSCP将生成模型的表达力与单模态策略的训练和推理效率相结合,无需长时间的反向传播链。我们的方法在离线、离线到在线和在线强化学习设置中均能有效扩展,显著优于基于扩散的基线方法在速度和适应性方面。我们进一步将SSCP扩展到目标条件强化学习中,使平坦策略能够利用子目标结构,而无需显式的层次推理。SSCP在标准的离线强化学习和行为克隆基准测试中均取得了强劲的成绩,作为深度强化学习和序列决策领域的通用、具表达力且高效的框架。代码已公开:https://github.com/PrajwalKoirala/SSCP-Single-Step-Completion-Policy

关键词

引用

@article{arxiv.2506.21427,
  title  = {Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning},
  author = {Prajwal Koirala and Cody Fleming},
  journal= {arXiv preprint arXiv:2506.21427},
  year   = {2026}
}

备注

ICLR 2026