概率空间中流政策在线强化学习的迭代细化
机器学习
2025-10-20 v1
摘要
行为克隆与流/扩散政策在从演示中学习复杂技能方面表现出色,但仍易受到分布迁移的影响,标准RL方法因其迭代推理过程及现有解决方案的局限性,难以对这些模型进行微调。本文引入了步进流政策(Stepwise Flow Policy, SWFP)框架,基于将流匹配推理过程通过固定步长欧拉方案离散化天然与最优传输中的Jordan-Kinderlehrer-Otto(JKO)原则一致的关键洞见。SWFP将全局流分解为一系列小的、逐步的分布变换。每一步对应一次JKO更新,通过正则化使策略变化保持在前一次迭代附近,确保基于熵正则化的在线适应稳定。这种分解产生一种高效算法,通过级联小流模块对预训练的流进行微调,具有显著优势:更简单/更快的子模型训练、降低计算和内存成本,以及基于Wasserstein信任区域的可证明稳定性。全面实验表明,SWFP在稳定性、效率和多样化机器人控制基准测试中的适应性能方面均优于先前方法。
引用
@article{arxiv.2510.15388,
title = {Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning},
author = {Mingyang Sun and Pengxiang Ding and Weinan Zhang and Donglin Wang},
journal= {arXiv preprint arXiv:2510.15388},
year = {2025}
}