随机均值流政策:基于熵镜像梯度的单步生成控制
机器学习
2026-05-22 v2 人工智能
摘要
在线无经验强化学习(RL)由两项相互关联的选择决定:策略类别和更新规则。高斯政策计算快且熵可解析,但难以处理多模态动作分布。生成式政策更具表达力,但常需迭代抽样或缺乏可解析的熵估计。在优化方面,SAC等软政策改进和镜像梯度(MD)可视为最小化不同的KL散度:前者将策略向由价值引导的玻尔兹曼分布移动,后者则对每次更新进行正则化以对抗前一策略。将熵正则化与MD约束相结合因此具有吸引力,因为它支持探索同时稳定策略改进;然而,生成的目标可能是多模态的,难以被单模态高斯政策匹配。我们提出随机均值流政策(SMFP),一种将高斯噪声映射到动作的单步生成政策,通过均值流变换实现这种随机重参数化,产生可解析的熵替代品,使SMFP能在无经验镜像梯度下以统一目标进行训练,以实现探索性且稳定的改进。在七个MuJoCo基准测试中,SMFP在高斯和生成式基准之间取得改进,同时保持单步推理效率。
引用
@article{arxiv.2605.21282,
title = {Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent},
author = {Zeyuan Wang and Da Li and Yulin Chen and Yuehu Gong and Yanming Guo and Ye Shi and Liang Bai and Tianyuan Yu and Yanwei Fu},
journal= {arXiv preprint arXiv:2605.21282},
year = {2026}
}