中文

论科学数据在机器学习中公平透明使用的准备度

机器学习 2024-12-18 v2 人工智能 数字图书馆

摘要

为了确保机器学习(ML)系统的公平性和可信赖性,近期的立法倡议和 ML 社区的相关研究指出了记录用于训练 ML 模型的数据的必要性。此外,为了可复现性,许多科学领域的数据共享实践在近年来不断演进。在此意义上,学术机构对这些实践的采纳鼓励研究人员在同行评审出版物(如数据论文)中发布其数据和技术文档。在本研究中,我们分析了这种更广泛的科学数据文档如何满足 ML 社区和监管机构将其用于 ML 技术的需求。我们检查了不同领域的 4041 篇数据论文样本,评估了其完整性、所要求维度的覆盖情况以及近年来的趋势。我们重点关注记录最多和最少的维度,并将结果与发布数据集描述论文的 ML 专题会议(NeurIPS D&B track)的结果进行比较。最终,我们为数据创建者和科学数据发布者提出了一套建议指南,以提高其数据在 ML 技术中透明且更公平使用的准备度。

关键词

引用

@article{arxiv.2401.10304,
  title  = {On the Readiness of Scientific Data for a Fair and Transparent Use in Machine Learning},
  author = {Joan Giner-Miguelez and Abel Gómez and Jordi Cabot},
  journal= {arXiv preprint arXiv:2401.10304},
  year   = {2024}
}