多样、困难与反常实例(D2O):一种用于物体分类的新测试集
计算机视觉与模式识别
2023-01-31 v1 人工智能
摘要
测试集是评估模型与衡量物体识别乃至更广义计算机视觉与人工智能进展的组成部分。然而,现有的物体识别测试集存在诸多缺陷,例如偏向 ImageNet 的特征与特性(如 ImageNet-V2)、局限于特定类型刺激(如 ObjectNet 中的室内场景)、以及低估模型性能(如 ImageNet-A)。为缓解这些问题,我们引入了一个名为 D2O 的新测试集,其与现有测试集足够不同。图像由生成图像与从网络爬取的图像混合而成。它们多样、未经修改、代表真实世界场景,并导致最先进模型以高置信度误分类。为强调泛化,我们的数据集按设计不附带训练集。它包含分布于 36 个类别的 8,060 张图像,其中 29 个出现在 ImageNet 中。我们数据集上的最佳 Top-1 准确率约为 60%,远低于 ImageNet 上 91% 的最佳 Top-1 准确率。我们发现流行的视觉 API 在 D2O 类别如“人脸”、“汽车”和“猫”上检测物体表现很差。我们的数据集还带有一个“杂项”类别,我们在其上测试了图像标注模型。总体而言,我们的研究表明 D2O 测试集包含难度各异的图像混合,并可预测模型的平均情形性能。它可在未来数年内挑战物体识别模型,并推动这一基础领域的更多研究。
引用
@article{arxiv.2301.12527,
title = {Diverse, Difficult, and Odd Instances (D2O): A New Test Set for Object Classification},
author = {Ali Borji},
journal= {arXiv preprint arXiv:2301.12527},
year = {2023}
}