面向离散与连续动作任务的动作候选驱动截断双 Q 学习
机器学习
2022-03-23 v1 人工智能
摘要
双 Q 学习是马尔可夫决策过程(MDP)问题中一种流行的强化学习算法。截断双 Q 学习作为双 Q 学习的有效变体,采用截断双估计器来近似最大期望动作值。由于截断双估计器的低估偏差,截断双 Q 学习在某些随机环境中的性能可能下降。本文为减少低估偏差,提出了一种基于动作候选的截断双估计器用于双 Q 学习。具体而言,我们首先从一组估计器中选出具有较高动作值的精英动作候选集。然后,在这些候选中,从另一组估计器中选择价值最高的动作。最后,我们利用第二组估计器中的最大值对第一组估计器中所选动作的动作值进行截断,该截断值用于近似最大期望动作值。理论上,我们的截断双 Q 学习中的低估偏差随动作候选数量的减少而单调衰减。此外,动作候选的数量控制了高估与低估偏差之间的权衡。另外,我们还通过近似精英连续动作候选将截断双 Q 学习扩展到连续动作任务。我们通过实验验证,我们的算法在一些玩具环境中能更准确地估计最大期望动作值,并在多个基准问题上取得良好性能。
引用
@article{arxiv.2203.11526,
title = {Action Candidate Driven Clipped Double Q-learning for Discrete and Continuous Action Tasks},
author = {Haobo Jiang and Jin Xie and Jian Yang},
journal= {arXiv preprint arXiv:2203.11526},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2105.00704