少样本图像分类基准偏离现实太远:以语义任务采样重建更优基准
计算机视觉与模式识别
2022-05-12 v1
摘要
每天都有新的方法被提出以攻克少样本图像分类(Few-Shot Image Classification),并在学术基准上展现出越来越好的性能。然而,我们观察到这些当前基准并未准确代表我们所遇到的真实工业用例。在本工作中,通过定性与定量研究,我们揭示出广泛使用的基准tieredImageNet存在严重偏差,其任务由语义极不相似的类组成,例如浴缸、卷心菜、披萨、史奇派克犬和刺菜蓟。这使得tieredImageNet(及类似基准)无法用于评估模型解决通常涉及更细粒度分类的真实用例的能力。我们利用关于tieredImageNet各类的语义信息来缓解此偏差,并生成了一个改进的、均衡的基准。进一步,我们还使用Danish Fungi 2020数据集引入了一个新的少样本图像分类基准。该基准提出了具有不同细粒度的大量评估任务。此外,该基准包含多类任务(例如由100个类组成),这是一种具有挑战性但在工业应用中非常常见的设定。我们的实验揭示了任务难度与其类间语义相似度之间的相关性,以及最先进方法在多类少样本分类上的严重性能下降,这对这些方法的扩展能力提出了质疑。我们希望我们的工作能鼓励社区进一步质疑标准评估流程的质量及其与现实应用的关联性。
引用
@article{arxiv.2205.05155,
title = {Few-Shot Image Classification Benchmarks are Too Far From Reality: Build Back Better with Semantic Task Sampling},
author = {Etienne Bennequin and Myriam Tami and Antoine Toubhans and Celine Hudelot},
journal= {arXiv preprint arXiv:2205.05155},
year = {2022}
}
备注
CVPR 2022 Workshop on Vision Datasets Understanding