面向深度神经网络监督器的结构化评估
机器学习
2019-03-08 v2 软件工程
摘要
近年来,深度神经网络(DNN)提升了多个非安全相关产品的质量。然而,在将 DNN 部署于安全关键应用之前,需要对其鲁棒性进行系统分析。当输入与训练集不相似时,DNN 面临一个常见挑战,这可能导致尽管对输入缺乏正确认知却仍做出高置信度预测。此前多项研究提出用监督器来补充 DNN,以检测输入何时超出网络范围。然而,这些监督器大多使用特定的性能指标针对选定场景进行开发和测试。在本工作中,我们强调需要以结构化的方式评估和比较监督器的性能。我们提出了一个框架,由组织为六个测试用例的四个数据集组成,并结合七个评估指标。这些测试用例提供了不同的复杂度,包含来自公开来源的数据以及一个由模拟驾驶场景图像组成的新数据集。我们计划将后者公开。我们的框架可用于支持 DNN 监督器评估,进而为 DNN 在安全关键应用中的开发、验证和部署提供动机。
引用
@article{arxiv.1903.01263,
title = {Towards Structured Evaluation of Deep Neural Network Supervisors},
author = {Jens Henriksson and Christian Berger and Markus Borg and Lars Tornberg and Cristofer Englund and Sankar Raman Sathyamoorthy and Stig Ursing},
journal= {arXiv preprint arXiv:1903.01263},
year = {2019}
}
备注
Preprint of paper accepted for presentation at The First IEEE International Conference on Artificial Intelligence Testing, April 4-9, 2019, San Francisco East Bay, California, USA