统计悬崖边缘的深度强化学习
机器学习
2022-01-06 v4 人工智能
统计方法学
机器学习
摘要
深度强化学习(RL)算法主要通过在大量任务套件上比较相对性能来评估。深度 RL 基准上多数已发表的结果比较了跨任务聚合性能的点估计(如均值和中位数分数),忽略了有限次训练运行所带来的统计不确定性。自街机学习环境(ALE)起,向计算密集型基准的转变导致了每任务仅评估少量运行的做法,加剧了点估计中的统计不确定性。本文认为,在少运行深度 RL 体制下,可靠的评估不能忽略结果中的不确定性,否则将面临减缓该领域进展的风险。我们使用 Atari 100k 基准上的案例研究阐明这一点,发现仅从点估计得出的结论与更彻底的统计分析得出的结论之间存在显著差异。为提高该领域对少量运行报告结果的信心,我们主张报告聚合性能区间估计,并提出性能剖面以解释结果的变异性,同时给出更稳健高效的聚合指标(如四分位均值分数)以减小结果不确定性。利用此类统计工具,我们审视了现有算法在其他广泛使用的 RL 基准(包括 ALE、Procgen 和 DeepMind Control Suite)上的性能评估,再次揭示了先前比较中的差异。我们的发现呼吁改变深度 RL 中性能评估的方式,为此我们提出了更严格的评估方法学,并配有开源库 rliable,以防止不可靠结果使该领域停滞。
引用
@article{arxiv.2108.13264,
title = {Deep Reinforcement Learning at the Edge of the Statistical Precipice},
author = {Rishabh Agarwal and Max Schwarzer and Pablo Samuel Castro and Aaron Courville and Marc G. Bellemare},
journal= {arXiv preprint arXiv:2108.13264},
year = {2022}
}
备注
Outstanding Paper Award at NeurIPS 2021. Website: https://agarwl.github.io/rliable. 28 Pages, 33 Figures