再来一局:Atari 环境下深度强化学习智能体的变异性
机器学习
2019-04-15 v1 人工智能
机器学习
摘要
强化学习中的可复现性颇具挑战:来自诸多来源(如学习算法、所学策略以及环境本身)的不可控随机性,已导致研究者通过单一环境下多个随机种子的聚合性能指标来报告所学智能体的表现。遗憾的是,强化学习智能体中仍存在有害的变异性来源,使得报告常见汇总统计量成为不可靠的性能度量。我们的实验展示了流行的 OpenAI Baselines 代码库中常用智能体的变异性。我们主张将训练后智能体性能作为分布而非点估计进行报告。
引用
@article{arxiv.1904.06312,
title = {Let's Play Again: Variability of Deep Reinforcement Learning Agents in Atari Environments},
author = {Kaleigh Clary and Emma Tosch and John Foley and David Jensen},
journal= {arXiv preprint arXiv:1904.06312},
year = {2019}
}
备注
NeurIPS 2018 Critiquing and Correcting Trends Workshop