平均场情形下带神经网络逼近的熵正则化MDP策略梯度的收敛性
最优化与控制
2022-06-17 v2 人工智能
机器学习
概率论
机器学习
摘要
我们研究无限时域、连续状态与动作空间以及熵正则化马尔可夫决策过程(MDPs)中策略梯度的全局收敛性。我们考虑在平均场情形下采用(单隐层)神经网络逼近的softmax策略。在关联的平均场概率测度中加入了额外的熵正则化,并在2-Wasserstein度量下研究相应的梯度流。我们证明目标函数沿梯度流递增。进一步,我们证明若平均场测度意义下的正则化足够强,则梯度流以指数速度收敛到唯一的平稳解,该解即为正则化MDP目标的唯一极大元。最后,我们研究了沿梯度流的值函数相对于正则化参数与初值的敏感性。我们的结果依赖于对非线性Fokker-Planck-Kolmogorov方程的细致分析,并推广了Mei等人2020年与Agarwal等人2020年的开创性工作,后者量化了表格情形下熵正则化MDP策略梯度的全局收敛速率。
引用
@article{arxiv.2201.07296,
title = {Convergence of Policy Gradient for Entropy Regularized MDPs with Neural Network Approximation in the Mean-Field Regime},
author = {Bekzhan Kerimkulov and James-Michael Leahy and David Šiška and Lukasz Szpruch},
journal= {arXiv preprint arXiv:2201.07296},
year = {2022}
}