通过最大化表示多样性防止集成 Q 学习中的价值函数崩溃
机器学习
2022-01-24 v3 人工智能
机器学习
摘要
经典的 DQN 算法受限于所学 Q 函数的过高估计偏差。后续的算法提出了减少该问题的技术,但未能完全消除它。最近,Maxmin 和 Ensemble Q-learning 算法利用学习器集成提供的不同估计来减少过高估计偏差。遗憾的是,这些学习器可能在参数空间或表示空间中收敛到同一点,从而退回到经典的单神经网络 DQN。在本文中,我们描述了一种在这些算法中最大化集成多样性的正则化技术。我们提出并比较了五种受经济学理论和共识优化启发的正则化函数。我们表明,正则化方法显著优于 Maxmin 和 Ensemble Q-learning 算法以及非集成基线。
引用
@article{arxiv.2006.13823,
title = {Preventing Value Function Collapse in Ensemble {Q}-Learning by Maximizing Representation Diversity},
author = {Hassam Ullah Sheikh and Ladislau Bölöni},
journal= {arXiv preprint arXiv:2006.13823},
year = {2022}
}
备注
Accepted in Deep Reinforcement Learning Workshop at NeurIPS 2020