AI 文档记录了什么?对 32K 份 AI 模型卡片的系统分析
软件工程
2024-02-09 v1 人工智能
机器学习
摘要
AI 模型的迅速普及凸显了详尽文档记录的重要性,因为它能让用户理解、信任并在各种应用中有效利用这些模型。尽管鼓励开发者制作模型卡片,但这些卡片包含多少信息或包含哪些信息尚不清楚。在本研究中,我们对 Hugging Face(一个分发和部署 AI 模型的领先平台)上的 32,111 份 AI 模型文档进行了全面分析。我们的调查揭示了当前模型卡片文档记录的实践情况。大多数下载量大的 AI 模型都提供了模型卡片,但这些卡片的信息量参差不齐。我们发现,涉及环境影响、局限性和评估的部分填写率最低,而训练部分填写最一致。我们分析了每个部分的内容,以刻画从业者的优先关注点。有趣的是,关于数据的讨论相当多,有时其重视程度与模型本身相当甚至更高。为了评估模型卡片的影响,我们进行了一项干预研究,为 42 个之前没有或只有稀疏模型卡片的流行模型添加了详细的模型卡片。我们发现,添加模型卡片与每周下载率的增加存在中等程度的相关性。我们的研究为通过大规模数据科学和语言学分析来审视模型文档的社区规范和实践开辟了新视角。
引用
@article{arxiv.2402.05160,
title = {What's documented in AI? Systematic Analysis of 32K AI Model Cards},
author = {Weixin Liang and Nazneen Rajani and Xinyu Yang and Ezinwanne Ozoani and Eric Wu and Yiqun Chen and Daniel Scott Smith and James Zou},
journal= {arXiv preprint arXiv:2402.05160},
year = {2024}
}