中文

数据集多样性指标及其对分类模型的影响

计算机视觉与模式识别 2026-03-17 v1

摘要

数据集的多样性通常被视为获取稳健模型的重要方面。然而,多样性的定义往往未被明确或在不同论文中存在差异,虽然已有一些指标,但这些多样性的量化往往在开发新算法时被忽视。本文研究了多个数据集多样性指标在图像、文本和元数据上的行为,分别使用具有受控扰动的玩具数据集 MorphoMNIST 和公开的胸部 X 光数据集 PadChest。我们评估了这些指标是否相互关联,也是否与临床专家的直觉相符。我们还评估了这些指标是否与下游任务性能相关,以及它们如何影响模型的训练动力学。我们发现,AUC 与图像或无参考元数据多样性指标之间的关联有限,但与 FID 和语义多样性指标之间的关联更高。最后,临床专家指出,扫描仪是实际操作中多样性的主要来源。然而,我们发现将另一个扫描仪添加到训练集中会导致捷足达权的学习。本研究使用的代码已公开于 https://github.com/TheoSourget/dataset_diversity_evaluation。

关键词

引用

@article{arxiv.2603.15276,
  title  = {Dataset Diversity Metrics and Impact on Classification Models},
  author = {Théo Sourget and Niclas Claßen and Jack Junchi Xu and Rob van der Goot and Veronika Cheplygina},
  journal= {arXiv preprint arXiv:2603.15276},
  year   = {2026}
}