集成激进 Q-Learning:同时实现高样本效率与高渐近性能
机器学习
2022-11-18 v3 人工智能
摘要
无模型深度强化学习(DRL)的最新进展表明,简单的无模型方法在具有挑战性的高维连续控制任务中可以非常有效。特别地,截断分位数评论家(TQC)借助评论家的分布表示在 MuJoCo 基准上达到了最先进的渐近训练性能;随机集成双重 Q-Learning(REDQ)利用高更新数据比和目标随机化实现了与最先进基于模型方法相竞争的高样本效率。在本文中,我们提出了一种新颖的无模型算法,集成激进 Q-Learning(AQE),它改进了 REDQ 的样本效率性能和 TQC 的渐近性能,从而在所有训练阶段提供整体的最先进性能。此外,AQE 非常简单,既不需要评论家的分布表示,也不需要目标随机化。AQE 的有效性进一步得到了我们大量实验、消融研究和理论结果的支撑。
引用
@article{arxiv.2111.09159,
title = {Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance},
author = {Yanqiu Wu and Xinyue Chen and Che Wang and Yiming Zhang and Keith W. Ross},
journal= {arXiv preprint arXiv:2111.09159},
year = {2022}
}