中文

运行是最严酷的老师:通过寻找误预测来估计 DNN 准确率

软件工程 2024-03-27 v1

摘要

深度神经网络(DNN)通常依赖一组未标记的真实世界数据(运行数据集)进行准确率测试,从中选取子集、手动标记并用作测试套件。该子集需较小(因手动标记成本)且能忠实代表运行上下文,所得测试套件中含误预测(即失败测试用例)样本的比例应与运行数据集大致相同。然而,在估计准确率的测试中,也期望从运行数据集的失败测试中尽可能多地学习,因为它们揭示了 DNN 可能的缺陷。一种智能采样策略可有意在测试套件中纳入许多导致误预测的样本,从而在保持获得可信无偏估计能力的同时,为 DNN 改进提供更有价值的输入。本文提出一种测试选择技术(DeepEST),它在 DNN 的运行数据集中主动寻找失败测试用例,旨在通过小而“信息丰富”的测试套件(即含大量误预测)评估 DNN 预期准确率,以用于后续 DNN 改进。文中描述了结合四个 DNN 模型与三个数据集的五个对象的实验。结果表明,DeepEST 提供的 DNN 准确率估计精度接近(且常优于)现有基于采样的 DNN 测试技术,同时在相同测试套件规模下多检测出 5 至 30 倍的误预测。

关键词

引用

@article{arxiv.2102.04287,
  title  = {Operation is the hardest teacher: estimating DNN accuracy looking for mispredictions},
  author = {Antonio Guerriero and Roberto Pietrantuono and Stefano Russo},
  journal= {arXiv preprint arXiv:2102.04287},
  year   = {2024}
}

备注

Paper accept at 43rd ACM/IEEE International Conference on Software Engineering, Madrid, Spain. May 2021