中文

QuaRL:面向快速且环境可持续的强化学习的量化方法

机器学习 2022-11-15 v6 人工智能 机器人学

摘要

深度强化学习在实现任务级自主性方面持续展现出巨大潜力,然而其计算和能量需求仍然高得令人望而却步。在本文中,我们通过将量化应用于强化学习来解决这一问题。为此,我们引入了一种新颖的强化学习(RL)训练范式 \textit{ActorQ},以加速 actor-learner 分布式 RL 训练。\textit{ActorQ} 利用 8 位量化 actor 来加速数据收集而不影响学习收敛。我们的量化分布式 RL 训练系统 \textit{ActorQ} 在一系列任务(Deepmind Control Suite)和不同 RL 算法(D4PG、DQN)上展示了端到端加速 \blue{between 1.5 ×\times and 5.41×\times},以及比全精度训练更快的收敛。此外,我们比较了 \textit{ActorQ} 与标准强化学习 \blue{algorithms} 在各种任务上的碳排放(CO2 千克数)。在各种设置下,我们表明 \textit{ActorQ} 通过相比全精度训练 RL 智能体实现 \blue{carbon emission improvements between 1.9×\times and 3.76×\times} 的碳排放改善,从而实现更环保的强化学习。我们相信这是未来许多使计算节能且可持续的强化学习成为可能的工作中的第一篇。源代码可在此处供公众使用:\url{https://github.com/harvard-edge/QuaRL}。

关键词

引用

@article{arxiv.1910.01055,
  title  = {QuaRL: Quantization for Fast and Environmentally Sustainable Reinforcement Learning},
  author = {Srivatsan Krishnan and Maximilian Lam and Sharad Chitlangia and Zishen Wan and Gabriel Barth-Maron and Aleksandra Faust and Vijay Janapa Reddi},
  journal= {arXiv preprint arXiv:1910.01055},
  year   = {2022}
}

备注

Equal contribution from first three authors. Updating with QuaRL for sustainable (carbon emissions) RL results