强化学习算法统计比较的搭车客指南
统计方法学
2022-08-30 v2 机器学习
摘要
持续检验实验结果的统计显著性是可重复科学的第一步强制性步骤。本文呈现了一份用于严格比较强化学习算法的搭车客指南。在引入统计检验的概念后,我们回顾了相关的统计检验,并根据假阳性率和统计功效作为样本量(种子数)和效应量的函数对它们进行了经验比较。我们进一步研究了这些检验对于最常见假设(正态分布、同分布、等方差)违背的鲁棒性。除模拟外,我们比较了通过在 Half-Cheetah 上运行 Soft-Actor Critic 和 Twin-Delayed Deep Deterministic Policy Gradient 获得的经验分布。我们最后提供了用于执行 RL 算法性能严格比较的指南与代码。
引用
@article{arxiv.1904.06979,
title = {A Hitchhiker's Guide to Statistical Comparisons of Reinforcement Learning Algorithms},
author = {Cédric Colas and Olivier Sigaud and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:1904.06979},
year = {2022}
}
备注
8 pages + supplementary material