基于推理的深度强化学习中算法与创新实现的协同适应
机器学习
2021-10-26 v3 人工智能
机器学习
摘要
近来许多针对函数近似的强化学习(RL)算法被提出。尽管它们具有清晰的算法区别,但也存在许多与算法无关且有时被低估的实现差异。这种算法创新与实现技巧的混合使得严格分析跨算法性能提升的来源变得困难。在本工作中,我们聚焦于一系列离屏策略基于推理的 actor-critic 算法——MPO、AWR 和 SAC——以解耦其算法创新与实现决策。我们通过单一控制即推理目标给出统一推导,将各算法归类为基于期望最大化(EM)或直接 Kullback-Leibler(KL)散度最小化,并将其余设定视为实现细节。我们进行了广泛的消融研究,发现每当实现细节与算法选择不匹配时均出现显著的性能下降。这些结果表明哪些实现或代码细节与算法协同适应并共同演化,哪些可跨算法迁移:例如,我们发现 tanh 高斯策略和网路规模高度适应算法类型,而层归一化和 ELU 对 MPO 的性能至关重要,但也能迁移至 SAC 中显著的增益。我们希望本工作能启发未来研究进一步厘清跨多种算法性能提升的来源,并允许研究者在彼此的算法与实现创新上继续构建。
引用
@article{arxiv.2103.17258,
title = {Co-Adaptation of Algorithmic and Implementational Innovations in Inference-based Deep Reinforcement Learning},
author = {Hiroki Furuta and Tadashi Kozuno and Tatsuya Matsushima and Yutaka Matsuo and Shixiang Shane Gu},
journal= {arXiv preprint arXiv:2103.17258},
year = {2021}
}
备注
Accepted at NeurIPS 2021. The implementation is available at: https://github.com/frt03/inference-based-rl