中文

数据集偏差的十年之战:我们走到哪了?

计算机视觉与模式识别 2025-03-04 v2 机器学习

摘要

我们在大规模、多样化且希望偏差较小的数据集以及更强大的神经网络架构的新时代,重新审视了 Torralba 和 Efros(2011)十年前提出的“数据集分类”实验。令人惊讶的是,我们观察到现代神经网络在分类图像来自哪个数据集的任务上可以达到极高的准确率:例如,在由 YFCC、CC 和 DataComp 数据集组成的三分类问题上,我们在留出的验证数据上报告了 84.7% 的准确率。我们进一步的实验表明,这样的数据集分类器可以学习到可泛化且可迁移的语义特征,这无法用记忆来解释。我们希望我们的发现能启发社区重新思考涉及数据集偏差的问题。

关键词

引用

@article{arxiv.2403.08632,
  title  = {A Decade's Battle on Dataset Bias: Are We There Yet?},
  author = {Zhuang Liu and Kaiming He},
  journal= {arXiv preprint arXiv:2403.08632},
  year   = {2025}
}

备注

Published in ICLR 2025 (Oral Presentation)