中文

面向 actor-critic 方法的带保守优势学习的同步双重 Q 学习

机器学习 2022-05-10 v1 人工智能

摘要

Actor-critic 强化学习(RL)算法在连续控制任务中取得了令人印象深刻的性能。然而,它们仍面临两个重要障碍,即低样本效率与过高估计偏差。为此,我们提出带保守优势学习的同步双重 Q 学习(SDQ-CAL)。我们的 SDQ-CAL 基于用优势学习对贝尔曼最优算子进行修改,提升了离策略 actor-critic RL 的双重 Q 学习。具体而言,SDQ-CAL 通过修改奖励来促进从经验中区分最优动作与其他动作,从而提高样本效率。此外,它通过在双重估计器上同时更新一对评论家来缓解过高估计问题。大量实验表明,我们的算法实现了偏差更小的价值估计,并在一系列连续控制基准任务中达到了最先进(SOTA)性能。我们在 \url{https://github.com/LQNew/SDQ-CAL} 发布了方法的源代码。

关键词

引用

@article{arxiv.2205.03819,
  title  = {Simultaneous Double Q-learning with Conservative Advantage Learning for Actor-Critic Methods},
  author = {Qing Li and Wengang Zhou and Zhenbo Lu and Houqiang Li},
  journal= {arXiv preprint arXiv:2205.03819},
  year   = {2022}
}