中文

解决 Actor-Critic 方法中的函数逼近误差

人工智能 2018-10-23 v3 机器学习 机器学习

摘要

在深度 Q 学习等基于值的强化学习方法中,函数逼近误差已知会导致价值估计过高与次优策略。我们表明该问题在 actor-critic 设定下依然存在,并提出新机制以最小化其对 actor 与 critic 的影响。我们的算法构建于 Double Q-learning 之上,通过取一对 critic 之间的最小值来限制过高估计。我们建立了目标网络与过高估计偏差之间的联系,并建议延迟策略更新以减少单次更新误差并进一步提升性能。我们在 OpenAI gym 任务集上评估了我们的方法,在所测试的每个环境中均优于当前最优方法。

关键词

引用

@article{arxiv.1802.09477,
  title  = {Addressing Function Approximation Error in Actor-Critic Methods},
  author = {Scott Fujimoto and Herke van Hoof and David Meger},
  journal= {arXiv preprint arXiv:1802.09477},
  year   = {2018}
}

备注

Accepted at ICML 2018