解决 Actor-Critic 方法中的函数逼近误差
人工智能
2018-10-23 v3 机器学习
机器学习
摘要
在深度 Q 学习等基于值的强化学习方法中,函数逼近误差已知会导致价值估计过高与次优策略。我们表明该问题在 actor-critic 设定下依然存在,并提出新机制以最小化其对 actor 与 critic 的影响。我们的算法构建于 Double Q-learning 之上,通过取一对 critic 之间的最小值来限制过高估计。我们建立了目标网络与过高估计偏差之间的联系,并建议延迟策略更新以减少单次更新误差并进一步提升性能。我们在 OpenAI gym 任务集上评估了我们的方法,在所测试的每个环境中均优于当前最优方法。
引用
@article{arxiv.1802.09477,
title = {Addressing Function Approximation Error in Actor-Critic Methods},
author = {Scott Fujimoto and Herke van Hoof and David Meger},
journal= {arXiv preprint arXiv:1802.09477},
year = {2018}
}
备注
Accepted at ICML 2018