中文

深度度量张量正则化策略梯度

机器学习 2023-05-19 v1

摘要

策略梯度算法是深度强化学习技术的一个重要族类。过往诸多研究致力于利用一阶策略梯度信息来训练策略网络。不同于这些工作,本文研究受如下信念驱动:恰当利用并控制与策略梯度相关的 Hessian 信息可显著提升策略梯度算法的性能。引起我们关注的一项关键 Hessian 信息是 Hessian 迹,其给出了欧氏策略参数空间中策略梯度向量场的散度。我们设定目标,通过在参数空间中引入度量张量场 gabg_ab,将该欧氏策略参数空间推广为一般的黎曼流形。这通过新近发展的数学工具、深度学习算法与度量张量深度神经网络(DNNs)得以实现。借助这些技术进展,我们提出一种新的策略梯度算法,其学习最小化黎曼流形中的绝对散度以作为一种重要正则化机制,使黎曼流形得以平滑其策略梯度向量场。新近开发的算法在若干基准强化学习问题上作了实验研究。我们的实验清晰表明,新的度量张量正则化算法可显著优于未使用本正则化技术的对应算法。附加实验分析进一步表明,经训练的度量张量 DNN 及相应度量张量 gabg_{ab} 可有效将绝对散度降至零。

关键词

引用

@article{arxiv.2305.11017,
  title  = {Deep Metric Tensor Regularized Policy Gradient},
  author = {Gang Chen and Victoria Huang},
  journal= {arXiv preprint arXiv:2305.11017},
  year   = {2023}
}