严格的智能体评估:一种揭示灾难性故障的对抗性方法
机器学习
2018-12-06 v1 密码学与安全
机器学习
摘要
本文解决了在自动驾驶等安全关键领域中评估学习系统的问题,其中故障可能带来灾难性后果。我们关注两个问题:搜索学习智能体发生故障的场景,以及评估其故障概率。强化学习中标准的智能体评估方法——Vanilla Monte Carlo(朴素蒙特卡洛),可能完全遗漏故障,从而导致不安全智能体的部署。我们证明这对于当前智能体是一个问题,其中即使匹配训练所用的计算量有时也不足以进行评估。为弥补这一不足,我们借鉴罕见事件概率估计文献,提出了一种对抗性评估方法。我们的方法将评估聚焦于对抗性选择的情境,同时仍提供无偏的故障概率估计。关键难点在于识别这些对抗性情境——由于故障罕见,驱动优化的信号很少。为解决此问题,我们提出了一种延续方法,在相关但鲁棒性较差的智能体中学习故障模式。我们的方法还允许复用已为训练智能体而收集的数据。我们在两个标准领域——类人控制与模拟驾驶——上展示了对抗性评估的有效性。实验结果表明,我们的方法能够发现灾难性故障,并以比标准评估方案快多个数量级的速度估计智能体故障率,耗时从数分钟到数小时而非数天。
引用
@article{arxiv.1812.01647,
title = {Rigorous Agent Evaluation: An Adversarial Approach to Uncover Catastrophic Failures},
author = {Jonathan Uesato and Ananya Kumar and Csaba Szepesvari and Tom Erez and Avraham Ruderman and Keith Anderson and Krishmamurthy and Dvijotham and Nicolas Heess and Pushmeet Kohli},
journal= {arXiv preprint arXiv:1812.01647},
year = {2018}
}