基于镜像梯度和熵约束的流匹配策略优化
机器学习
2026-05-27 v3
摘要
在平衡策略表达性与探索-开发权衡方面,线上强化学习 (RL) 面临的核心挑战是如何在保持策略表达能力的同时实现有效的探索。虽然基于随机微分方程 (SDE) 的扩散策略能够表示复杂、多模态的动作分布,但它们存在两个关键局限性:其随机逆过程使得熵难以计算(导致需要启发式探索),以及通过长 denoising 链计算策略梯度代价高昂且不稳定。本文证明,基于常微分方程 (ODE) 的流匹配天然解决了这些问题,通过实现无仿真策略优化和可计算的熵,为此提供了理论依据。基于此,我们引入了基于镜像梯度和熵约束的流匹配策略优化框架 (FMER)。该框架的核心思想体现在三个方面:首先,理论上证明,最小化基于优势加权的条件流匹配损失可作为策略镜像梯度的无仿真替代方案。该方法无需通过 ODE 求解器进行反向传播,即可将速度场引导至高价值区域。其次,推导解析熵目标,以校正由 tanh 变换(将无界潜在空间映射到有界动作)引起的密度扭曲,从而实现原则化的最大熵优化。最后,根据有效样本量动态调整镜像梯度温度,以在训练期间强制执行稳健的信任区域。实验评估表明,FMER 在稀疏奖励的 FrankaKitchen 环境中取得优异性能,同时在标准稠密奖励的 MuJoCo 基准测试中保持竞争力。
引用
@article{arxiv.2603.17685,
title = {Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints},
author = {Ting Gao and Stavros Orfanoudakis and Nan Lin and Winnie Daamen and Serge Hoogendoorn and Elvin Isufi},
journal= {arXiv preprint arXiv:2603.17685},
year = {2026}
}