中文

误差可控的 Actor-Critic 算法

机器学习 2021-09-08 v2

摘要

值函数的误差不可避免地导致高估现象,并对算法的收敛产生负面影响。为减轻近似误差的负面影响,我们提出了误差可控的 Actor-Critic(Error Controlled Actor-Critic),其确保将值函数中的近似误差限制在可控范围内。我们分析了近似误差如何阻碍 actor-critic 方法的优化过程。接着,我们推导了 Q 函数近似器的近似误差上界,并发现通过在训练策略时限制每两个连续策略之间的 KL 散度可以降低该误差。在一系列连续控制任务上的实验结果表明,所提出的 actor-critic 算法明显降低了近似误差,并显著优于其他无模型强化学习(RL)算法。

关键词

引用

@article{arxiv.2109.02517,
  title  = {Error Controlled Actor-Critic},
  author = {Xingen Gao and Fei Chao and Changle Zhou and Zhen Ge and Chih-Min Lin and Longzhi Yang and Xiang Chang and Changjing Shang},
  journal= {arXiv preprint arXiv:2109.02517},
  year   = {2021}
}