中文

ML/AI存储库中数据集文档的完整性:实证调查

数字图书馆 2025-03-19 v1 人工智能 人机交互 机器学习

摘要

机器学习/人工智能(ML/AI)是计算机科学和计算机工程领域中受到最多注意和资金关注的学科之一。数据是ML/AI的关键要素,因此越来越重要的是确保用户充分了解所使用数据集的质量以及生成其过程,以便能够追踪、分析并在可能的情况下减轻对下游影响。数据集文档是有益的工具,可从这个角度来考虑。本文旨在调查数据集文档的实践状况,衡量几个流行数据集在ML/AI存储库中文档的完整性。我们创建了一个数据集文档模式——文档测试表(DTS)——以识别应该始终附加到数据集中的信息(以确保正确的数据集选择和知情使用),根据相关文献中的研究。我们使用 DTS 验证了来自四个不同存储库的 100 个流行数据集,以调查哪些信息被包含。总体而言,我们观察到关于数据收集和数据处理背景的相关文档缺失,尤其是透明度不足。

关键词

引用

@article{arxiv.2503.13463,
  title  = {Completeness of Datasets Documentation on ML/AI repositories: an Empirical Investigation},
  author = {Marco Rondina and Antonio Vetrò and Juan Carlos De Martin},
  journal= {arXiv preprint arXiv:2503.13463},
  year   = {2025}
}