广义薛定谔桥下用于同策略强化学习的路径空间镜像下降
机器学习
2026-05-29 v2
摘要
经典的PPO和镜像下降策略优化等同策略算法通过可处理的动作似然提供稳定的近端策略更新,但通常以简单的高斯策略实例化,其在复杂连续控制任务中的表达能力可能受限。基于扩散和流模型的生成式策略提供了更具表达力的动作分布,但它们自然地定义了多步去噪路径上的分布,其终端动作密度往往难以处理,从而与基于似然的同策略近端更新产生不匹配。为解决这一不匹配问题,我们引入GSB-MDPO(广义薛定谔桥镜像下降策略优化),它将同策略生成式策略优化形式化为状态条件生成路径上的广义薛定谔桥问题,并通过镜像下降策略优化实例化由此产生的路径测度更新。其关键洞见在于,GSB路径空间KL散度在MDPO中扮演近端项的角色,同时上界约束终端动作KL散度,从而无需显式的终端动作似然评估即可直接控制执行的动作分布。在Playground和Gym-MuJoCo的14个连续控制任务上的实验证明了GSB-MDPO的经验有效性,并支持将路径空间正则化作为多步生成策略的原则性近端更新方法。
引用
@article{arxiv.2603.21621,
title = {Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schr\"odinger Bridge},
author = {Yuehu Gong and Zeyuan Wang and Yulin Chen and Shutong Ding and Qingyuan Zhou and Yanwei Fu},
journal= {arXiv preprint arXiv:2603.21621},
year = {2026}
}