Softmax 策略镜像上升的快速收敛
机器学习
2025-06-02 v2 人工智能
机器人学
摘要
自然策略梯度是一种常用的策略优化算法,可以看作是概率空间中的镜像上升。最近,Vaswani 等人 [2021] 引入了一种对应于在 logits 对偶空间中进行镜像上升的策略梯度方法。我们改进了该算法,去除了其对动作间归一化的需求,并分析了由此产生的方法(称为 SPMA)。对于表格 MDP,我们证明了采用常数步长的 SPMA 与 NPG 的线性收敛速度相当,并且比常数步长的(加速)softmax 策略梯度实现了更快的收敛。为了处理大型状态-动作空间,我们将 SPMA 扩展为使用对数线性策略参数化。与 NPG 不同,将 SPMA 推广到线性函数逼近设置不需要兼容函数逼近。与 NPG 的一种实用推广 MDPO 不同,具有线性函数逼近的 SPMA 只需要求解凸 softmax 分类问题。我们证明 SPMA 能够线性收敛到最优值函数的邻域。我们将 SPMA 扩展以处理非线性函数逼近,并在 MuJoCo 和 Atari 基准上评估了其经验性能。我们的结果表明,与 MDPO、PPO 和 TRPO 相比,SPMA 始终取得相似或更好的性能。
引用
@article{arxiv.2411.12042,
title = {Fast Convergence of Softmax Policy Mirror Ascent},
author = {Reza Asad and Reza Babanezhad and Issam Laradji and Nicolas Le Roux and Sharan Vaswani},
journal= {arXiv preprint arXiv:2411.12042},
year = {2025}
}
备注
AISTATS 2025