中文

向深度学习测试输入生成器评估迈出一步

机器学习 2025-04-09 v2 计算机视觉与模式识别 软件工程

摘要

深度学习 (DL) 系统日益部署在安全关键领域,但仍面临鲁棒性问题可能导致重大失效。虽然已开发出众多测试输入生成器 (TIG) 来评估DL鲁棒性,但缺乏对其在不同维度上效果的全面评估。本文对四种最先进TIG——DeepHunter、DeepFault、AdvGAN和SinVAD——进行全面评估,涵盖故障揭示能力、自然性、多样性和效率等多个关键方面。我们的实证研究基于三个预训练模型 (LeNet-5、VGG16和EfficientNetB3) 和数据集的不同复杂度 (MNIST、CIFAR-10和ImageNet-1K) 来评估TIG性能。我们的发现揭示了在鲁棒性揭示能力、测试案例生成方式和计算效率方面的重要权衡。结果还表明,TIG的性能随数据集复杂度而显著变化,一些在简单数据集上表现良好的工具在更复杂的数据集上可能效果下降,而另一些工具则保持稳定的性能或更好的可扩展性。本文为选择符合特定目标和数据集特征的合适TIG提供了实用指导。尽管如此,仍需进一步工作来解决TIG的局限性,推动其在实际安全关键系统中的应用。

关键词

引用

@article{arxiv.2504.02329,
  title  = {Towards Assessing Deep Learning Test Input Generators},
  author = {Seif Mzoughi and Ahmed Haj yahmed and Mohamed Elshafei and Foutse Khomh and Diego Elias Costa},
  journal= {arXiv preprint arXiv:2504.02329},
  year   = {2025}
}

备注

Accepted to EASE 2025