中文

超越彩虹:在桌面 PC 上实现高性能深度强化学习

人工智能 2025-05-22 v2 机器学习

摘要

Rainbow Deep Q-Network (DQN) 证明了结合多种独立增强可以显著提升强化学习 (RL) 智能体的性能。在本文中,我们提出了 'Beyond The Rainbow' (BTR),一种将 RL 文献中的六种改进集成到 Rainbow DQN 中的新算法,在桌面 PC 上建立了 RL 的新最先进水平,在 Atari-60 上取得了人归一化四分位均值 (IQM) 为 7.4 的成绩。除了 Atari,我们还展示了 BTR 处理复杂三维游戏的能力,成功训练智能体游玩 Super Mario Galaxy、Mario Kart 和 Mortal Kombat,且仅需最少的算法改动。在设计 BTR 时考虑了计算效率,智能体可以在 12 小时内使用高端桌面 PC 在 2 亿帧 Atari 数据上进行训练。此外,我们对每个组件进行了详细的消融实验,使用多种指标分析其性能和影响。代码可在 https://github.com/VIPTankz/BTR 获取。

关键词

引用

@article{arxiv.2411.03820,
  title  = {Beyond The Rainbow: High Performance Deep Reinforcement Learning on a Desktop PC},
  author = {Tyler Clark and Mark Towers and Christine Evers and Jonathon Hare},
  journal= {arXiv preprint arXiv:2411.03820},
  year   = {2025}
}

备注

9 main pages, 28 total. Accepted at ICML 2025 (Poster)