反向流匹配:基于扩散与流策略的在线强化学习统一框架
机器学习
2026-01-14 v1 系统与控制
系统与控制
摘要
扩散与流策略因其强大的表达能力在在线强化学习(RL)中日益受到重视,但如何高效地训练它们仍是一个关键挑战。在线强化学习的一个根本困难在于缺乏来自目标分布的直接样本;相反,目标是由 Q 函数定义的未归一化玻尔兹曼分布。为了解决这个问题,针对扩散策略提出了两类看似不同的方法:噪声期望族,它利用噪声的加权平均作为训练目标;以及梯度期望族,它使用 Q 函数梯度的加权平均。然而,这些目标之间如何形式化地关联,或者它们能否被综合成一个更通用的公式,目前尚不清楚。在本文中,我们提出了一个统一框架——反向流匹配(RFM),它严谨地解决了在没有直接目标样本的情况下训练扩散和流模型的问题。通过采用反向推理视角,我们将训练目标表述为给定中间噪声样本的后验均值估计问题。关键地,我们引入了 Langevin Stein 算子来构造零均值控制变量,推导出一类通用的估计器,有效降低了重要性采样方差。我们证明了现有的噪声期望和梯度期望方法是这个更广泛类别中的两个具体实例。这种统一视角带来了两个关键进展:它将针对玻尔兹曼分布的目标能力从扩散策略扩展到了流策略,并使得能够原则性地结合 Q 值和 Q 梯度信息来推导出最优的最小方差估计器,从而提高了训练效率和稳定性。我们将 RFM 实例化以在在线强化学习中训练流策略,并在连续控制基准测试上展示了相比扩散策略基线的性能提升。
引用
@article{arxiv.2601.08136,
title = {Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies},
author = {Zeyang Li and Sunbochen Tang and Navid Azizan},
journal= {arXiv preprint arXiv:2601.08136},
year = {2026}
}