中文

平均场情形下带神经网络逼近的熵正则化MDP策略梯度的收敛性

最优化与控制 2022-06-17 v2 人工智能 机器学习 概率论 机器学习

摘要

我们研究无限时域、连续状态与动作空间以及熵正则化马尔可夫决策过程(MDPs)中策略梯度的全局收敛性。我们考虑在平均场情形下采用(单隐层)神经网络逼近的softmax策略。在关联的平均场概率测度中加入了额外的熵正则化,并在2-Wasserstein度量下研究相应的梯度流。我们证明目标函数沿梯度流递增。进一步,我们证明若平均场测度意义下的正则化足够强,则梯度流以指数速度收敛到唯一的平稳解,该解即为正则化MDP目标的唯一极大元。最后,我们研究了沿梯度流的值函数相对于正则化参数与初值的敏感性。我们的结果依赖于对非线性Fokker-Planck-Kolmogorov方程的细致分析,并推广了Mei等人2020年与Agarwal等人2020年的开创性工作,后者量化了表格情形下熵正则化MDP策略梯度的全局收敛速率。

关键词

引用

@article{arxiv.2201.07296,
  title  = {Convergence of Policy Gradient for Entropy Regularized MDPs with Neural Network Approximation in the Mean-Field Regime},
  author = {Bekzhan Kerimkulov and James-Michael Leahy and David Šiška and Lukasz Szpruch},
  journal= {arXiv preprint arXiv:2201.07296},
  year   = {2022}
}