探索人工智能中的数据集文档:对 Hugging Face 上数据集卡片的大规模分析
机器学习
2024-01-26 v1 人工智能
摘要
机器学习的进步与数据集的创建密切相关。尽管数据文档被广泛认为对机器学习的可靠性、可复现性和透明度至关重要,但我们缺乏对当前数据集文档实践的系统性实证理解。为了阐明这个问题,我们以 Hugging Face——最大的机器学习模型和数据集共享与协作平台之一——作为一个突出的案例研究。通过分析 Hugging Face 上所有 7,433 个数据集文档,我们的调查提供了 Hugging Face 数据集生态系统的概览以及对数据集文档实践的洞见,得出 5 个主要发现:(1)数据集卡片的完成率显示出与数据集流行度相关的显著异质性。(2)对数据集卡片内每个部分的细致检查显示,实践者似乎优先考虑数据集描述和数据集结构部分,而使用数据的注意事项部分所占内容比例最低。(3)通过分析每个部分内的子部分并利用主题建模来识别关键主题,我们揭示了每个部分讨论的内容,并强调了涵盖技术和社会影响以及使用数据的注意事项部分中局限性的重要主题。(4)我们的发现还强调了在用法部分中提高数据集可访问性和可复现性的必要性。(5)此外,我们的人工标注评估强调了全面的数据集内容在塑造个人对数据集卡片整体质量认知中的关键作用。总体而言,我们的研究为通过大规模数据科学分析来分析数据集文档提供了一个独特的视角,并强调了在机器学习研究中需要更全面的数据集文档。
引用
@article{arxiv.2401.13822,
title = {Navigating Dataset Documentations in AI: A Large-Scale Analysis of Dataset Cards on Hugging Face},
author = {Xinyu Yang and Weixin Liang and James Zou},
journal= {arXiv preprint arXiv:2401.13822},
year = {2024}
}
备注
Accepted to the main conference of ICLR 2024