中文

绿色深度强化学习:基于 Atari 基准的能源与碳效率分析

机器学习 2025-09-08 v1 性能

摘要

深度强化学习(DRL)日益增长的计算需求引发了关于训练大规模模型环境和经济成本的担忧。虽然学习性能方面的算法效率已被广泛研究,但DRL算法的能源需求、温室气体排放和货币成本仍然鲜有探讨。本文提出了对七种最先进DRL算法——DQN、TRPO、A2C、ARS、PPO、RecurrentPPO 和 QR-DQN——能源消耗的系统性基准测试研究,这些算法使用 Stable Baselines 实现。每个算法在十款 Atari 2600 游戏上训练一个百万步,实时测量功耗以估算总能源使用、CO2 效当量排放和基于美国全国平均电价的电费。我们的结果揭示了能源效率和训练成本在算法之间存在显著差异,一些算法在实现相当学习性能的同时,能源消耗降低最高可达 24%(ARS 对比 DQN),CO2 排放降低近 68%,货币成本降低近 68%(QR-DQN 对比 RecurrentPPO)。我们进一步分析了学习性能、训练时间、能源使用和财务成本之间的权衡,强调在不牺牲学习性能的情况下,算法选择可以显著减轻环境和经济影响。该研究为开发面向能源效率和成本效益的 DRL 实践提供了可操作性见解,并为将可持续性考虑纳入未来算法设计和评估奠定了基础。

关键词

引用

@article{arxiv.2509.05273,
  title  = {Greener Deep Reinforcement Learning: Analysis of Energy and Carbon Efficiency Across Atari Benchmarks},
  author = {Jason Gardner and Ayan Dutta and Swapnoneel Roy and O. Patrick Kreidl and Ladislau Boloni},
  journal= {arXiv preprint arXiv:2509.05273},
  year   = {2025}
}

备注

Submitted to a journal - under review