中文

ADER:在探索与鲁棒性之间自适应的 actor-critic 方法

机器学习 2021-09-09 v1

摘要

将离策略强化学习方法与神经网络等函数逼近器结合已被发现会导致值函数的高估与次优解。已有如 TD3 等改进被提出以解决该问题。然而,我们惊讶地发现其在某些基础环境中的表现落后于原生 actor-critic 方法(如 DDPG)。本文中,我们表明某些情形的失败可归因于探索不足。我们揭示了 TD3 中探索不足的症结,并针对该问题提出一种新算法,即在探索与鲁棒性之间自适应(ADER)。为增强探索能力同时消除高估偏差,我们在值估计中引入由估计不确定性计算的动态惩罚项,其考虑了不同学习阶段中不确定性的不同构成。在若干具挑战性环境中的实验证明了所提方法在连续控制任务中的优越性。

关键词

引用

@article{arxiv.2109.03443,
  title  = {ADER:Adapting between Exploration and Robustness for Actor-Critic Methods},
  author = {Bo Zhou and Kejiao Li and Hongsheng Zeng and Fan Wang and Hao Tian},
  journal= {arXiv preprint arXiv:2109.03443},
  year   = {2021}
}