基于神经函数逼近的 Bellman 残差误差分析与优化
机器学习
2022-03-15 v5
摘要
深度强化学习(DRL)的近期发展展示了神经网络在求解具有大型甚至连续状态空间的挑战性问题中的优越性能。一种具体方法是部署神经网络,通过最小化均方 Bellman 误差(MSBE)函数来逼近值函数。尽管 DRL 取得了巨大成功,开发可靠且高效的数值算法以最小化 MSBE 仍具有重大科学意义与实际需求。这一挑战部分源于底层优化问题高度非凸,或如半梯度算法那样使用了不完整的梯度信息。在本工作中,我们从光滑优化视角分析 MSBE,并开发了一种高效的近似牛顿算法。首先,我们对误差函数进行临界点分析,并为神经网络的优化与设计选择提供技术见解。当假设存在全局最小值且目标满足特定条件时,使用过参数化神经网络可避免次优局部极小值。我们基于分析构建了两种变体的高斯牛顿残差梯度算法。第一种变体适用于离散状态空间与精确学习。我们在数值上确认了该算法的理论性质,如局部二次收敛至全局最小值。第二种采用采样,可用于连续设定。我们利用连续控制问题实证展示了所提算法的可行性与泛化能力,并对我们的临界点分析给出数值验证。我们概述了将半梯度方法与 Hessian 信息结合的困难。要受益于二阶信息,训练期间必须考虑 MSBE 的完整导数。
引用
@article{arxiv.2106.08774,
title = {Analysis and Optimisation of Bellman Residual Errors with Neural Function Approximation},
author = {Martin Gottwald and Sven Gronauer and Hao Shen and Klaus Diepold},
journal= {arXiv preprint arXiv:2106.08774},
year = {2022}
}
备注
29 pages, 8 figures