强化学习的 Wasserstein 公式化:策略优化的最优传输视角
机器学习
2026-04-17 v1 最优化与控制
概率论
摘要
我们提出了一个用于强化学习 (RL) 的几何框架,将策略视为映射到动作概率的 Wasserstein 空间中的映射。首先,我们定义了由平稳分布诱导的黎曼结构,并证明了其在一般情况下的存在性。然后,我们定义了策略的切空间并刻画了测地线,特别是探讨了从状态空间映射到动作空间上概率测度切空间的向量场的可测性。接着,我们构建了一个一般的 RL 优化问题,并使用 Otto 微积分构造了梯度流。我们计算了能量的梯度和 Hessian 矩阵,提供了形式化的二阶分析。最后,我们用低维问题的数值示例说明了该方法,直接从我们的理论形式中计算梯度。对于高维问题,我们使用神经网络对策略进行参数化,并基于代价的遍历近似对其进行优化。
引用
@article{arxiv.2604.14765,
title = {Wasserstein Formulation of Reinforcement Learning. An Optimal Transport Perspective on Policy Optimization},
author = {Mathias Dus},
journal= {arXiv preprint arXiv:2604.14765},
year = {2026}
}