中文

带函数逼近的重球动量加速 Actor-Critic 算法

机器学习 2024-08-19 v2 人工智能

摘要

通过使用参数化价值函数替代蒙特卡洛 rollout 来进行价值估计,actor-critic(AC)算法可以降低随机策略梯度的方差,从而改善收敛率。虽然现有工作主要关注在马尔可夫噪声下 AC 算法收敛率的分析,但动量对 AC 算法的影响在很大程度上仍未被探索。在这项工作中,我们首先提出了一种基于重球动量的优势 actor-critic(HB-A2C)算法,通过将重球动量集成到由线性函数参数化的评论家递归中。当样本轨迹遵循马尔可夫决策过程时,我们定量地证明了所提出的 HB-A2C 算法的加速能力。我们的理论结果表明,所提出的 HB-A2C 在具有马尔可夫噪声的强化学习任务中以 \ooϵ2\oo{\epsilon^{-2}} 次迭代找到 ϵ\epsilon-近似驻点。此外,我们还揭示了学习率与样本轨迹长度之间的依赖关系。通过仔细选择评论家递归中的动量因子,所提出的 HB-A2C 可以平衡初始化和随机逼近引入的误差。

关键词

引用

@article{arxiv.2408.06945,
  title  = {Heavy-Ball Momentum Accelerated Actor-Critic With Function Approximation},
  author = {Yanjie Dong and Haijun Zhang and Gang Wang and Shisheng Cui and Xiping Hu},
  journal= {arXiv preprint arXiv:2408.06945},
  year   = {2024}
}