用于鲁棒模仿学习的MAGICAL基准
机器学习
2020-11-03 v1 人工智能
摘要
模仿学习(IL)算法通常在用于创建示范的同一环境中评估。这奖励了对某一特定环境中示范的精确复现,但几乎未提供关于算法如何将示范者意图鲁棒地泛化到显著不同的部署设置的信息。本文提出MAGICAL基准套件,它通过量化IL算法在实践中可能遇到的不同类型分布偏移的鲁棒性,允许对泛化进行系统评估。使用MAGICAL套件,我们确认现有IL算法严重过拟合于提供示范的上下文。我们还表明,用于减少过拟合的标准方法在创建狭窄感知不变性方面有效,但不足以实现需要显著不同行为的上下文迁移,这表明需要新方法以鲁棒地泛化示范者意图。MAGICAL套件的代码和数据可在 https://github.com/qxcv/magical/ 获取。
引用
@article{arxiv.2011.00401,
title = {The MAGICAL Benchmark for Robust Imitation},
author = {Sam Toyer and Rohin Shah and Andrew Critch and Stuart Russell},
journal= {arXiv preprint arXiv:2011.00401},
year = {2020}
}
备注
NeurIPS 2020 conference paper (poster)