我们到底在测量什么?通过无监督语义聚类重新思考网络规模自然图像集合中的数据偏差
计算机视觉与模式识别
2026-04-16 v1
摘要
在计算机视觉中,量化数据偏差的常用方法是训练模型以区分不同数据集。随后高分类准确率被解释为有意义的语义差异。这种方法假设标准的图像增强能够成功抑制低层次、非语义线索,因此剩余的性能必须反映出真实的语义差异。我们证明,这一根本假设在大规模自然图像集合中并不成立。高分类准确率常常由分辨率基的损伤驱动,这些损伤源于图像分辨率分布以及在调整大小过程中出现的插值效应,形成结构性的指纹。这些损伤形成稳健的、特定于数据集的签名,即使在常规图像损伤下仍然保持。通过控制实验,我们展示模型即使在非语义、程序生成的图像上也能获得强的数据集分类,证明其依赖浅层线索。为此,我们重新审视这个数十年来的数据集可分离性想法,但不采用监督分类。相反,我们引入一种无监督方法来衡量真实的语义可分离性。我们的框架直接评估语义相似性,通过聚类基础视觉模型中的语义丰富特征,故意绕过数据集标签上的监督分类。应用于主要的网络规模数据集时,监督方法报告的高可分离性大多消失,聚类准确率降至接近随机水平。这揭示了常规基于分类的评估系统地高估了语义偏差,幅度巨大。
引用
@article{arxiv.2604.13610,
title = {What Are We Really Measuring? Rethinking Dataset Bias in Web-Scale Natural Image Collections via Unsupervised Semantic Clustering},
author = {Amir Hossein Saleknia and Mohammad Sabokrou},
journal= {arXiv preprint arXiv:2604.13610},
year = {2026}
}