中文

用于神经网络测试的用例优先级排序

软件工程 2019-01-15 v1 机器学习 机器学习

摘要

深度神经网络(DNN)正日益被用于自动驾驶汽车、自主飞行器、医疗诊断和工业机器人等多种安全与任务关键系统中的感知与控制功能。此类系统的失效可能导致生命或财产损失,因此需要进行严格的验证与确认以提供高可信度。尽管形式化验证方法正在被研究,测试仍是评估此类系统可靠性的主要技术。由于 DNN 所处理任务的性质,获取测试预言数据(即给定输入的期望输出,亦称标签)的成本很高,这显著影响了可执行的测试数量与质量。因此,以有意义的方式对 DNN 测试输入数据进行优先级排序以降低标注成本,能大幅提升测试效能。本文提出利用从模型计算过程导出的 DNN“情感”度量,作为识别可能暴露弱点的输入的途径。我们从经验上评估了三种此类用于优先级排序的情感度量——置信度、不确定性和惊奇度——并比较了它们在暴露故障能力和重训练有效性方面的表现。结果表明,情感度量能有效标记出暴露不可接受 DNN 行为的输入。对于 MNIST 模型,正确标记输入的平均比例在 88% 至 94.8% 之间。

关键词

引用

@article{arxiv.1901.03768,
  title  = {Input Prioritization for Testing Neural Networks},
  author = {Taejoon Byun and Vaibhav Sharma and Abhishek Vijayakumar and Sanjai Rayadurgam and Darren Cofer},
  journal= {arXiv preprint arXiv:1901.03768},
  year   = {2019}
}