中文

平均场情形下单层隐藏层神经网络 softmax 策略梯度的全局最优性

机器学习 2020-10-23 v1 机器学习

摘要

我们研究了具有 softmax 策略和非线性函数逼近、通过策略梯度算法训练的无限 horizon 折扣马尔可夫决策过程的策略优化问题。我们聚焦于平均场情形下的训练动力学,例如对宽单层隐藏层神经网络行为的建模,其中通过熵正则化鼓励探索。这些模型的动力学被确立为参数空间中分布的 Wasserstein 梯度流。我们进一步证明了在对其初始化施加温和条件下,该动力学不动点的全局最优性。

关键词

引用

@article{arxiv.2010.11858,
  title  = {Global optimality of softmax policy gradient with single hidden layer neural networks in the mean-field regime},
  author = {Andrea Agazzi and Jianfeng Lu},
  journal= {arXiv preprint arXiv:2010.11858},
  year   = {2020}
}

备注

22 pages, 1 figure