中文

深度强化学习样本效率的进展度量

机器学习 2021-02-10 v1 计算机与社会

摘要

采样得到的环境转移是深度强化学习(DRL)算法的关键输入。当前的 DRL 基准通常允许廉价且容易地生成大量样本,使得所认知的 DRL 进展未必对应于改进的样本效率。由于模拟真实世界过程往往极其困难,且收集真实世界经验成本高昂,样本效率是 DRL 经济相关应用的重要指标。我们通过比较多种算法根据相应出版物中的训练曲线达到给定性能水平所需样本数量,考察了 Atari 游戏和连续控制任务上样本效率的进展。我们发现样本效率呈指数级进展,估计翻倍时间在 Atari 上约为 10 至 18 个月,在基于状态的连续控制上为 5 至 24 个月,在基于像素的连续控制上约为 4 至 9 个月,具体取决于任务和性能水平。

关键词

引用

@article{arxiv.2102.04881,
  title  = {Measuring Progress in Deep Reinforcement Learning Sample Efficiency},
  author = {Florian E. Dorner},
  journal= {arXiv preprint arXiv:2102.04881},
  year   = {2021}
}

备注

26 pages, 6 figures, 5 tables