面向相似但非相同数据集上DNN分类模型有效性比较研究的规范性评估协议
机器学习
2022-09-07 v1 计算机视觉与模式识别
摘要
深度神经网络(DNN)模型正越来越多地使用新的复现测试数据集进行评估,这些数据集经过精心创建以与旧有的流行基准数据集相似。然而,与预期相反,DNN分类模型在这些复现测试数据集上表现出显著、一致且很大程度上无法解释的准确率下降。虽然流行的评估方法利用各测试数据集中所有可用数据点来评定模型准确率,我们认为这样做阻碍了我们充分捕捉DNN模型行为并对其准确率抱有 realistic 预期。因此,我们提出一种规范性评估协议,适用于对DNN模型在多个测试数据集上的准确率进行比较研究,该协议利用可根据不同准则(包括不确定性相关信息)选取的数据点子集。借助这一新评估协议,我们测定了个DNN模型在(1)CIFAR-10与ImageNet数据集以及(2)其复现数据集上的准确率。实验结果表明,已确立的基准数据集与其复现数据集之间观测到的准确率下降持续低于已发表工作中报告的准确率下降(即模型在复现测试数据集上表现更好),而那些已发表工作依赖于未利用不确定性相关信息的常规评估方法。
引用
@article{arxiv.2209.01848,
title = {A Principled Evaluation Protocol for Comparative Investigation of the Effectiveness of DNN Classification Models on Similar-but-non-identical Datasets},
author = {Esla Timothy Anzaku and Haohan Wang and Arnout Van Messem and Wesley De Neve},
journal= {arXiv preprint arXiv:2209.01848},
year = {2022}
}
备注
17 pages, 7 figures, 2 Algorithms, 3 tables