中文

强化学习算法统计比较的搭车客指南

统计方法学 2022-08-30 v2 机器学习

摘要

持续检验实验结果的统计显著性是可重复科学的第一步强制性步骤。本文呈现了一份用于严格比较强化学习算法的搭车客指南。在引入统计检验的概念后,我们回顾了相关的统计检验,并根据假阳性率和统计功效作为样本量(种子数)和效应量的函数对它们进行了经验比较。我们进一步研究了这些检验对于最常见假设(正态分布、同分布、等方差)违背的鲁棒性。除模拟外,我们比较了通过在 Half-Cheetah 上运行 Soft-Actor Critic 和 Twin-Delayed Deep Deterministic Policy Gradient 获得的经验分布。我们最后提供了用于执行 RL 算法性能严格比较的指南与代码。

关键词

引用

@article{arxiv.1904.06979,
  title  = {A Hitchhiker's Guide to Statistical Comparisons of Reinforcement Learning Algorithms},
  author = {Cédric Colas and Olivier Sigaud and Pierre-Yves Oudeyer},
  journal= {arXiv preprint arXiv:1904.06979},
  year   = {2022}
}

备注

8 pages + supplementary material