中文

递归最小二乘优势行动者-评论者算法

机器学习 2022-02-15 v2

摘要

作为深度强化学习中的重要算法,优势行动者-评论者(A2C)已在带有原始像素输入的离散与连续控制任务中广泛成功,但其样本效率仍须进一步提升。在传统强化学习中,行动者-评论者算法通常使用递归最小二乘(RLS)技术更新线性函数逼近器的参数以加速收敛。然而,A2C 算法极少使用该技术训练深度神经网络(DNN)以改善样本效率。本文提出两种基于 RLS 的新型 A2C 算法并研究其性能。两种所提算法称为 RLSSA2C 与 RLSNA2C,均使用 RLS 方法训练评论者网络与行动者网络的隐藏层。它们之间的主要区别在于策略学习步骤。RLSSA2C 使用普通一阶梯度下降算法与标准策略梯度学习策略参数。RLSNA2C 使用克罗内克因子分解近似、RLS 方法与自然策略梯度来学习兼容参数与策略参数。此外,我们分析了两种算法的复杂度与收敛性,并给出进一步提升其收敛速度的三个技巧。最后,我们在 Atari 2600 环境中的 40 个游戏与 MuJoCo 环境中的 11 个任务上证明了两种算法的有效性。实验结果表明,我们的两种算法在多数游戏或任务上比原始 A2C 具有更好的样本效率,且比其他两种最先进算法具有更高的计算效率。

关键词

引用

@article{arxiv.2201.05918,
  title  = {Recursive Least Squares Advantage Actor-Critic Algorithms},
  author = {Yuan Wang and Chunyuan Zhang and Tianzong Yu and Meng Ma},
  journal= {arXiv preprint arXiv:2201.05918},
  year   = {2022}
}

备注

13 pages, 2 figures, 4 tables, IEEE TRANSACTIONS ON SYSTEMS, MAN, AND CYBERNETICS: SYSTEMS, under review