用于双重高效强化学习的 Dropout Q 函数
机器学习
2022-03-17 v2 人工智能
摘要
随机集成双重 Q 学习(REDQ)(Chen et al., 2021b)近期在连续动作强化学习基准上取得了最先进的样本效率。这种优越的样本效率得益于使用大型 Q 函数集成。然而,REDQ 的计算效率远低于 Soft Actor-Critic(SAC)(Haarnoja et al., 2018a)等非集成方法。为使 REDQ 更具计算效率,我们提出一种称为 DroQ 的计算效率改进方法,它是 REDQ 的一种变体,使用小型 dropout Q 函数集成。我们的 dropout Q 函数是配备了 dropout 连接和层归一化的简单 Q 函数。尽管实现简单,我们的实验结果表明 DroQ 具有双重(样本与计算)高效性。它取得了与 REDQ 相当的样本效率、远优于 REDQ 的计算效率,以及与 SAC 相当的计算效率。
引用
@article{arxiv.2110.02034,
title = {Dropout Q-Functions for Doubly Efficient Reinforcement Learning},
author = {Takuya Hiraoka and Takahisa Imagawa and Taisei Hashimoto and Takashi Onishi and Yoshimasa Tsuruoka},
journal= {arXiv preprint arXiv:2110.02034},
year = {2022}
}
备注
ICLR 2022. Source code: https://github.com/TakuyaHiraoka/Dropout-Q-Functions-for-Doubly-Efficient-Reinforcement-Learning Poster: https://drive.google.com/file/d/1_JSuwlUsMjzo6zRaAIcXXj3__AmOvu2t/view?usp=sharing Slides: https://drive.google.com/file/d/1ecq9SQ2KSNpfeblCkr6TYPz5gRk_Y4S8/view?usp=sharing