中文

基于最近邻函数逼近的理论严谨深度强化学习加速

机器学习 2021-10-12 v1 人工智能

摘要

近年来,深度强化学习(RL)通过将深度神经网络整合进 RL 框架取得了显著的实证成功。然而,这些算法通常需要大量训练样本且缺乏理论理解。为缓解这些问题,我们提出了一种理论严谨的最近邻(NN)函数逼近器,可改进深度 RL 方法中的价值网络。受人类相似性判断的启发,NN 逼近器利用过往观测的 rollout 估计动作价值,并可证明获得仅依赖于环境内在复杂度的较小后悔界。我们提出(1)最近邻 Actor-Critic(NNAC),一种展示函数逼近与深度 RL 结合实用性的在线策略梯度算法,以及(2)一个即插即用的 NN 更新模块,可辅助现有深度 RL 方法的训练。在经典控制与 MuJoCo 运动任务上的实验表明,NN 加速的智能体比基线智能体具有更高的样本效率与稳定性。基于其理论优势,我们相信 NN 逼近器可进一步应用于其他复杂领域以加速学习。

关键词

引用

@article{arxiv.2110.04422,
  title  = {Theoretically Principled Deep RL Acceleration via Nearest Neighbor Function Approximation},
  author = {Junhong Shen and Lin F. Yang},
  journal= {arXiv preprint arXiv:2110.04422},
  year   = {2021}
}