以更慢在线网络实现更快深度强化学习
机器学习
2023-04-19 v3 人工智能
摘要
深度强化学习算法常使用两个网络进行价值函数优化:一个在线网络,以及一个以某种延迟跟踪在线网络的目标网络。使用两个独立网络使智能体能够规避自举时产生的问题。本文为两种流行的深度强化学习算法,即 DQN 和 Rainbow,赋予了激励在线网络保持在目标网络邻近范围内的更新方式。这提升了深度强化学习在存在噪声更新时的鲁棒性。所得智能体称为 DQN Pro 和 Rainbow Pro,在 Atari 基准上相比原始对应算法展现出显著性能提升,证明了这一简单思想在深度强化学习中的有效性。我们的论文代码可在此获取:Github.com/amazon-research/fast-rl-with-slow-updates。
引用
@article{arxiv.2112.05848,
title = {Faster Deep Reinforcement Learning with Slower Online Network},
author = {Kavosh Asadi and Rasool Fakoor and Omer Gottesman and Taesup Kim and Michael L. Littman and Alexander J. Smola},
journal= {arXiv preprint arXiv:2112.05848},
year = {2023}
}
备注
Published at the Thirty-sixth Conference on Neural Information Processing Systems (NeurIPS 2022)