通过量化测试样本难度理解分布外准确率
机器学习
2022-03-30 v1 计算机视觉与模式识别
摘要
已有工作表明,尽管现代神经网络在分布内(ID)数据集上取得了显著的泛化性能,但在分布外(OOD)数据集上的准确率会显著下降 \cite{recht2018cifar, recht2019imagenet}。为理解为何多种模型在 OOD 数据集上持续犯更多错误,我们提出一种新度量来量化测试图像(ID 或 OOD)的难度,该难度取决于训练数据集与模型的交互。具体而言,我们引入\textit{混淆分数}作为图像难度的无标签度量,其基于一组训练模型所估计的类别条件概率来量化给定测试图像上的不一致程度。利用混淆分数,我们考察了 CIFAR-10 及其 OOD 衍生数据集。接着,通过按混淆分数对测试与 OOD 数据集进行划分,我们预测了不同架构下 ID 与 OOD 准确率之间的关系。这使我们能够仅使用 ID 测试标签来估计给定模型的 OOD 准确率。我们的观察表明,准确率下降的最大贡献来自于具有高混淆分数的图像。进一步检视后,我们报告了按混淆分数分组的误分类图像的性质:\textit{(i)} 高混淆分数图像包含出现在训练数据多个类别中的\textit{弱伪相关},且缺乏清晰的\textit{类别特定特征};\textit{(ii)} 低混淆分数图像表现出属于另一类别的伪相关,即\textit{类别特定伪相关}。
引用
@article{arxiv.2203.15100,
title = {Understanding out-of-distribution accuracies through quantifying difficulty of test samples},
author = {Berfin Simsek and Melissa Hall and Levent Sagun},
journal= {arXiv preprint arXiv:2203.15100},
year = {2022}
}
备注
18 pages, 15 figures