中文

离策略深度强化学习中的动作噪声:对探索与性能的影响

机器学习 2023-06-06 v3 人工智能

摘要

许多深度强化学习(D-RL)算法依赖于简单形式的探索,例如连续控制域中常用的加性动作噪声。通常,该动作噪声的缩放因子被选为超参数并在训练期间保持恒定。在本文中,我们关注连续控制离策略深度强化学习中的动作噪声。我们分析了所学策略如何受噪声类型、噪声尺度以及影响缩放因子衰减 schedule 的影响。我们考虑了两种最突出的动作噪声类型,高斯噪声与Ornstein-Uhlenbeck噪声,并通过系统性地改变噪声类型和尺度参数,以及测量预期回报与探索期间状态空间覆盖等关注变量,开展大规模实验。对于后者,我们提出了一种新颖的状态空间覆盖度量XUrel\operatorname{X}_{\mathcal{U}\text{rel}},相比先前提出的度量,其对靠近状态空间边界的点所引起的估计伪影更为鲁棒。更大的噪声尺度通常会增加状态空间覆盖。然而,我们发现使用更大噪声尺度来增加空间覆盖往往并无益处。相反,在训练过程中减小噪声尺度可降低方差并通常改善学习性能。我们得出结论:最佳噪声类型和尺度依赖于环境,并基于我们的观察推导出启发式规则以指导动作噪声的选择,作为进一步优化起点。

关键词

引用

@article{arxiv.2206.03787,
  title  = {Action Noise in Off-Policy Deep Reinforcement Learning: Impact on Exploration and Performance},
  author = {Jakob Hollenstein and Sayantan Auddy and Matteo Saveriano and Erwan Renaudo and Justus Piater},
  journal= {arXiv preprint arXiv:2206.03787},
  year   = {2023}
}

备注

Published in Transactions on Machine Learning Research (11/2022) https://openreview.net/forum?id=NljBlZ6hmG