平均场情形下单层隐藏层神经网络 softmax 策略梯度的全局最优性
机器学习
2020-10-23 v1 机器学习
摘要
我们研究了具有 softmax 策略和非线性函数逼近、通过策略梯度算法训练的无限 horizon 折扣马尔可夫决策过程的策略优化问题。我们聚焦于平均场情形下的训练动力学,例如对宽单层隐藏层神经网络行为的建模,其中通过熵正则化鼓励探索。这些模型的动力学被确立为参数空间中分布的 Wasserstein 梯度流。我们进一步证明了在对其初始化施加温和条件下,该动力学不动点的全局最优性。
引用
@article{arxiv.2010.11858,
title = {Global optimality of softmax policy gradient with single hidden layer neural networks in the mean-field regime},
author = {Andrea Agazzi and Jianfeng Lu},
journal= {arXiv preprint arXiv:2010.11858},
year = {2020}
}
备注
22 pages, 1 figure