中文

NeurIPS 的数据策管现状:对数据集与基准轨数据集开发实践的评估

计算机与社会 2025-01-06 v2

摘要

数据策管是一个起源于图书馆学和档案学的领域,其关于数据问题的学术研究和思考可追溯至数个世纪,甚至上千年。机器学习领域正日益认识到数据策管对于推进机器学习模型的应用和基础理解的重要性——数据集与基准测试轨道的创建本身就是一个明证。本文通过数据策管的视角,对 NeurIPS 的数据集开发实践进行了分析。我们提出了一个数据集文档评估框架,该框架由一个量规和工具包组成,是通过对数据策管原则的文献综述而开发的。我们使用该框架评估了 2021 年至 2023 年 NeurIPS 数据集与基准测试轨道中发表的 60 个数据集在当前数据集开发实践中的优势与不足。我们总结了关键发现和趋势。结果表明,在环境足迹、伦理考量和数据管理方面的文档需求更大。我们建议了针对性的策略和资源以改进这些领域的文档,并为 NeurIPS 的同行评审过程提供了建议,以优先考虑机器学习中严格的数据策管。最后,我们以数据集的形式提供了结果,展示了推荐的数据策管实践的各个方面。我们的量规和结果对于广泛改进机器学习领域的数据策管实践,以及对于研究机器学习实践的数据策管和科学技术研究学者都具有重要意义。我们的目标是支持数据集实践跨学科研究的持续改进,最终提高新数据集和基准的可重用性与可复现性,实现标准化和知情的人类监督,并夯实严谨和负责任的机器学习研究的基础。

关键词

引用

@article{arxiv.2410.22473,
  title  = {The State of Data Curation at NeurIPS: An Assessment of Dataset Development Practices in the Datasets and Benchmarks Track},
  author = {Eshta Bhardwaj and Harshit Gujral and Siyi Wu and Ciara Zogheib and Tegan Maharaj and Christoph Becker},
  journal= {arXiv preprint arXiv:2410.22473},
  year   = {2025}
}

备注

Accepted as spotlight poster in NeurIPS Datasets & Benchmarks track 2024