生成与检测真实歧义:DNN监督测试中被忽视的危险
软件工程
2023-09-11 v2 机器学习
摘要
深度神经网络(DNN)正成为现代软件系统的关键组成部分,但它们容易在不同于训练时观察到的条件(分布外输入)下失败,或者在对真正歧义的输入的失败——即在其标签中以非零概率允许多个类别的输入。近期工作提出了DNN监督器,以在其可能误分类造成危害之前检测高不确定性输入。为测试和比较DNN监督器的能力,研究者提出了测试生成技术,将测试工作聚焦于应被监督器识别为异常的高不确定性输入。然而,现有测试生成器旨在产生分布外输入。尚无现有的独立于模型和监督器的技术针对真正歧义测试输入的生成,即根据人类专家判断允许多个类别的输入。本文提出一种生成歧义输入以测试DNN监督器的新方法,并用其经验性地比较了若干现有监督器技术。特别地,我们提出AmbiGuess以生成图像分类问题的歧义样本。AmbiGuess基于正则化对抗自编码器的潜空间中的梯度引导采样。此外,我们进行了——据我们所知——最广泛的DNN监督器比较研究,考量其检测4种不同类型高不确定性输入(包括真正歧义输入)的能力。我们发现被测监督器的能力是互补的:最适于检测真实歧义的那些在无效、分布外和对抗输入上表现更差,反之亦然。
引用
@article{arxiv.2207.10495,
title = {Generating and Detecting True Ambiguity: A Forgotten Danger in DNN Supervision Testing},
author = {Michael Weiss and André García Gómez and Paolo Tonella},
journal= {arXiv preprint arXiv:2207.10495},
year = {2023}
}
备注
Accepted for publication at Springers "Empirical Software Engineering" (EMSE)