带函数逼近的重球动量加速 Actor-Critic 算法
机器学习
2024-08-19 v2 人工智能
摘要
通过使用参数化价值函数替代蒙特卡洛 rollout 来进行价值估计,actor-critic(AC)算法可以降低随机策略梯度的方差,从而改善收敛率。虽然现有工作主要关注在马尔可夫噪声下 AC 算法收敛率的分析,但动量对 AC 算法的影响在很大程度上仍未被探索。在这项工作中,我们首先提出了一种基于重球动量的优势 actor-critic(HB-A2C)算法,通过将重球动量集成到由线性函数参数化的评论家递归中。当样本轨迹遵循马尔可夫决策过程时,我们定量地证明了所提出的 HB-A2C 算法的加速能力。我们的理论结果表明,所提出的 HB-A2C 在具有马尔可夫噪声的强化学习任务中以 次迭代找到 -近似驻点。此外,我们还揭示了学习率与样本轨迹长度之间的依赖关系。通过仔细选择评论家递归中的动量因子,所提出的 HB-A2C 可以平衡初始化和随机逼近引入的误差。
引用
@article{arxiv.2408.06945,
title = {Heavy-Ball Momentum Accelerated Actor-Critic With Function Approximation},
author = {Yanjie Dong and Haijun Zhang and Gang Wang and Shisheng Cui and Xiping Hu},
journal= {arXiv preprint arXiv:2408.06945},
year = {2024}
}