中文

基于测试用例多样性的深度神经网络黑盒测试

软件工程 2023-04-21 v5 人工智能 机器学习

摘要

深度神经网络(DNNs)已广泛应用于包括图像处理、医疗诊断和自动驾驶在内的许多领域。然而,DNNs可能表现出可能导致关键错误的异常行为,特别是在用于安全关键系统时。受传统软件系统测试技术的启发,研究人员提出了神经元覆盖准则,作为源代码覆盖的类比,以指导DNN模型的测试。尽管关于DNN覆盖的研究非常活跃,最近的几项研究质疑了此类准则在指导DNN测试中的有用性。此外,从实际角度来看,这些准则是白盒的,因为它们需要访问DNN模型的内部或训练数据,这在许多情况下不可行或不方便。在本文中,我们研究黑盒输入多样性度量作为白盒覆盖准则的替代方案。为此,我们首先选择并调整三种多样性度量,并以受控方式研究它们衡量输入集实际多样性的能力。然后,我们使用四个数据集和五个DNN模型分析它们与故障检测的统计关联。我们进一步将多样性与最先进的白盒覆盖准则进行比较。我们的实验表明,依赖测试输入集中嵌入的图像特征的多样性是比覆盖准则更可靠的指标,可有效指导DNN的测试。事实上,我们发现我们选定的黑盒多样性度量之一在揭示故障能力和计算时间方面远远优于现有的覆盖准则。结果也证实了人们的怀疑,即最先进的覆盖度量不足以指导测试输入集的构建,以使用自然输入检测尽可能多的故障。

关键词

引用

@article{arxiv.2112.12591,
  title  = {Black-Box Testing of Deep Neural Networks Through Test Case Diversity},
  author = {Zohreh Aghababaeyan and Manel Abdellatif and Lionel Briand and Ramesh S and Mojtaba Bagherzadeh},
  journal= {arXiv preprint arXiv:2112.12591},
  year   = {2023}
}