通过双 TD 正则化 Actor 与 Critic 缓解深度强化学习的估计误差
机器学习
2023-11-08 v1 人工智能
摘要
我们通过引入包含一种新的双 TD 正则化 actor-critic(TDR)方法的解决机制,解决深度强化学习(DRL)中的估计偏差问题。它旨在减少过估计与欠估计误差。借助 TDR 并结合良好的 DRL 改进(如分布式学习与长 N 步代理阶段奖励(LNSS)方法),我们表明我们新的基于 TDR 的 actor-critic 学习使 DRL 方法在 DeepMind Control Suite 的具有挑战性环境中优于各自的基线。此外,它们将 TD3 和 SAC 分别提升到与 D4PG(当前 SOTA)相当的性能水平,并且它们还将 D4PG 的性能提高到以平均奖励、收敛速度、学习成功率和学习方差衡量的新 SOTA 水平。
引用
@article{arxiv.2311.03711,
title = {Mitigating Estimation Errors by Twin TD-Regularized Actor and Critic for Deep Reinforcement Learning},
author = {Junmin Zhong and Ruofan Wu and Jennie Si},
journal= {arXiv preprint arXiv:2311.03711},
year = {2023}
}