AdaStop:用于深度强化学习智能体可靠比较的自适应统计检验
机器学习
2025-06-03 v3 机器学习
摘要
近来,科学界对许多实证结果尤其是机器学习领域的统计可复现性提出了质疑。为助力解决这一可复现性危机,我们提出了一种理论上可靠的方法来比较一组算法的性能。我们在深度强化学习(Deep RL)中示例了我们的方法。一次深度 RL 算法执行的性能是一个随机变量。因此,需要多次独立执行来评估其性能。当比较具有随机性能的算法时,一个主要问题涉及需执行多少次执行才能确保比较结果在理论上是可靠的。深度 RL 领域的研究者常使用少于 5 次独立执行来比较算法:我们主张这一般而言是不够的。此外,当一次性比较超过 2 种算法时,我们必须使用多重检验过程以保持较低的误差保证。我们引入了 AdaStop,一种基于多重分组序贯检验的新统计检验。当用于比较算法时,AdaStop 自适应地调整执行次数,尽早停止,同时确保已收集足够信息以区分得分分布不同的算法。我们从理论上证明 AdaStop 具有较低的(族wise)错误概率。我们在多种用例中展示了 AdaStop 的有效性,包括玩具示例和具有挑战性的 Mujoco 环境上的深度 RL 算法。AdaStop 是首个适用于此类比较的统计检验:它既是对统计学的重大贡献,也是对强化学习及其他领域计算研究的重要贡献。
引用
@article{arxiv.2306.10882,
title = {AdaStop: adaptive statistical testing for sound comparisons of Deep RL agents},
author = {Timothée Mathieu and Riccardo Della Vecchia and Alena Shilova and Matheus Medeiros Centa and Hector Kohler and Odalric-Ambrym Maillard and Philippe Preux},
journal= {arXiv preprint arXiv:2306.10882},
year = {2025}
}