标准数据遮蔽意义:关于标准数据集的知情使用观点
机器学习
2025-01-08 v2 人机交互
摘要
标准数据集常被用于训练和评估机器学习模型。然而,由于对这些数据集标准性的假设,导致人们未深入探讨标签是否与相应用例对应的派生类别。我们通过审阅近期使用标准数据集的文献,展示了这一问题。我们发现,数据集的标准性似乎遮蔽了其实际的一致性和适用性,从而阻碍了基于这些数据集训练的模型信任。因此,我们反对对标准数据集的盲目使用,主张对其进行批判性检讨。为此,我们建议采用 Grounded Theory 结合通过可视化进行假设检验的方法,以评估用例、派生类别与标签之间的匹配度。我们以 20 Newsgroups 数据集和 MNIST 数据集为例,实施了这一方法。这两个数据集均被视为各自领域的标准数据集。结果表明,20 Newsgroups 数据集的标签不够精确,这意味着机器学习模型无法从中学习有意义的派生类别抽象,也无法从高准确率中得出结论。对于 MNIST 数据集,我们证明其标签定义得很好。我们得出结论,对于被视为标准的数据集,仍需评估其质量和适用性,以便学习有意义的抽象,从而提高基于这些数据集训练的机器学习模型的信任度。
引用
@article{arxiv.2406.13552,
title = {Standardness Clouds Meaning: A Position Regarding the Informed Usage of Standard Datasets},
author = {Tim Cech and Ole Wegen and Daniel Atzberger and Rico Richter and Willy Scheibel and Jürgen Döllner},
journal= {arXiv preprint arXiv:2406.13552},
year = {2025}
}