Tsallis 熵正则化下基于自助 Q 集成的高效深度强化学习探索
机器学习
2018-09-06 v2 机器学习
摘要
近来深度强化学习(DRL)在解决许多困难且大规模的 RL 问题上取得了卓越成功。然而,有效学习所需的高样本代价常使 DRL 在资源受限应用中难以负担。为提高样本效率与学习性能,本文提出一种新的 DRL 算法,其无缝整合熵驱动与自助驱动技术以实现对学习环境的高效深度探索。具体而言,将利用一般形式的 Tsallis 熵正则化器,基于最优动作选择策略的高效近似来驱动熵驱动探索。与许多依赖动作抖动策略进行探索的现有工作不同,我们的算法能高效探索具有明确探索价值的动作。同时,通过在不同的 Tsallis 熵正则化下采用 Q 网络集成,可进一步增强集成的多样性以实现有效的自助驱动探索。在 Atari 游戏任务上的实验清楚表明,与近期提出的包括 Bootstrapped Deep Q-Network 和 UCB Q-Ensemble 在内的探索方法相比,我们的新算法能为 DRL 实现更高效且有效的探索。
引用
@article{arxiv.1809.00403,
title = {Effective Exploration for Deep Reinforcement Learning via Bootstrapped Q-Ensembles under Tsallis Entropy Regularization},
author = {Gang Chen and Yiming Peng and Mengjie Zhang},
journal= {arXiv preprint arXiv:1809.00403},
year = {2018}
}