WD3:抑制深度强化学习中的估计偏差
机器学习
2023-11-07 v2 人工智能
摘要
由函数逼近引起的过估计现象是基于值的强化学习算法(如深度 Q 网络和 DDPG)中的一个已知问题,其可能导致次优策略。为解决该问题,TD3 取一对评论家(critics)之间的最小值。在本文中,我们在温和假设下证明 TD3 算法引入了低估偏差。为获得更精确的值函数估计,我们统一这两个对立面并提出一种新算法加权延迟深度确定性策略梯度(WD3),其通过对一对评论家加权来消除估计偏差并进一步提升性能。为证明 WD3 的有效性,我们比较了 DDPG、TD3 和 WD3 的值函数学习过程。结果验证了我们的算法确实消除了值函数的估计误差。此外,我们在连续控制任务上评估了我们的算法。我们观察到,在每项测试任务中,WD3 的性能始终优于或至少匹配最先进(state-of-the-art)算法\footnote{我们的代码见~\href{https://sites.google.com/view/ictai20-wd3/}{https://sites.google.com/view/ictai20-wd3/}。}。
引用
@article{arxiv.2006.12622,
title = {WD3: Taming the Estimation Bias in Deep Reinforcement Learning},
author = {Qiang He and Xinwen Hou},
journal= {arXiv preprint arXiv:2006.12622},
year = {2023}
}
备注
Accepted to ICTAI'20. Code: https://sites.google.com/view/ictai20-wd3/