Softmax 深度双确定性策略梯度
机器学习
2020-10-20 v1
摘要
一种广泛用于连续控制的 actor-critic 强化学习算法——深度确定性策略梯度(DDPG)——存在过高估计问题,这会对性能产生负面影响。尽管最先进的双延迟深度确定性策略梯度(TD3)算法缓解了过高估计问题,但它可能导致较大的低估偏差。在本文中,我们提出在连续控制中使用 Boltzmann softmax 算子进行值函数估计。我们首先从理论上分析了连续动作空间中的 softmax 算子。然后,我们揭示了 actor-critic 算法中 softmax 算子的一个重要性质,即它有助于平滑优化地形,这为该算子的益处提供了新见解。我们还设计了两种新算法,Softmax 深度确定性策略梯度(SD2)和 Softmax 深度双确定性策略梯度(SD3),通过将 softmax 算子建立在单估计量和双估计量之上,可有效改善过高估计和低估偏差。我们在具有挑战性的连续控制任务上进行了大量实验,结果表明 SD3 优于最先进的方法。
引用
@article{arxiv.2010.09177,
title = {Softmax Deep Double Deterministic Policy Gradients},
author = {Ling Pan and Qingpeng Cai and Longbo Huang},
journal= {arXiv preprint arXiv:2010.09177},
year = {2020}
}
备注
NeurIPS 2020