中文

多测试目标下测试选择指标的实证洞察:面向分布迁移

软件工程 2026-04-28 v1

摘要

深度学习(DL)系统在面对分布外(OOD)情景时可能 exhibit 意外行为,这在恶意软件检测和自动驾驶等安全关键领域构成严重风险。这凸显了在部署前对此类系统进行彻底测试的重要性。为此,研究人员提出了各种各样的测试选择指标,以有效选择输入。然而,现有指标的评估揭示了三个关键局限性:(1)测试目标范围有限,例如许多研究仅针对故障检测评估指标,导致其对性能估计的有效性尚不清楚;(2)对 OOD 情景的覆盖有限,自然分布迁移和标签迁移很少被考虑;(3)数据集选择偏差,大多数工作聚焦于图像数据,而其他模态则鲜有涉及。因此,缺乏一个统一的基准,能够检验这些指标在多种测试目标、多样化 OOD 情景以及不同数据模态下的表现。这给从业者留下了疑问:哪些测试选择指标最适合其特定目标和情境?为此,我们开展了对 15 项现有指标的大规模实证研究,评估它们在三个测试目标(故障检测、性能估计和再训练指导)、五类 OOD 情景(损坏、对抗、时间序列、自然和标签迁移)、三个数据模态(图像、文本和 Android 软件包)以及 13 个深度学习模型下的表现。总体而言,本研究涵盖 1,640 个实验情景,提供了全面的评估和统计分析。

关键词

引用

@article{arxiv.2604.23342,
  title  = {Empirical Insights of Test Selection Metrics under Multiple Testing Objectives and Distribution Shifts},
  author = {Jingyu Zhang and Fan Wang and Jacky Keung and Yihan Liao and Yan Xiao and Lei Ma},
  journal= {arXiv preprint arXiv:2604.23342},
  year   = {2026}
}

备注

Accepted for publication at the ACM International Conference on the Foundations of Software Engineering (FSE 2026)