面向离散与连续动作任务的基于动作候选的裁剪双 Q 学习
机器学习
2021-05-04 v1
摘要
双 Q 学习是马尔可夫决策过程(MDP)问题中一种流行的强化学习算法。裁剪双 Q 学习作为双 Q 学习的有效变体,采用裁剪双估计器来近似最大期望动作值。由于裁剪双估计器的低估偏差,裁剪双 Q 学习在某些随机环境中的性能可能下降。本文中,为减小低估偏差,我们提出一种用于双 Q 学习的基于动作候选的裁剪双估计器。具体而言,我们首先从一组估计器中选出具有较高动作值的精英动作候选集合。然后,在这些候选中,从另一组估计器选出价值最高的动作。最后,我们使用第二组估计器中的最大值来裁剪第一组估计器中所选动作的动作值,该裁剪值用于近似最大期望动作值。理论上,我们的裁剪双 Q 学习中的低估偏差随动作候选数量减少而单调衰减。此外,动作候选数量控制了高估与低估偏差之间的权衡。另外,我们还通过近似精英连续动作候选将裁剪双 Q 学习推广至连续动作任务。我们通过实验验证,我们的算法在一些玩具环境中能更准确地估计最大期望动作值,并在多个基准问题上取得良好性能。
引用
@article{arxiv.2105.00704,
title = {Action Candidate Based Clipped Double Q-learning for Discrete and Continuous Action Tasks},
author = {Haobo Jiang and Jin Xie and Jian Yang},
journal= {arXiv preprint arXiv:2105.00704},
year = {2021}
}
备注
Accepted by AAAI2021