关于兼具公平性、隐私性与监管规范的责任式机器学习数据集
机器学习
2024-08-20 v4 计算机视觉与模式识别
摘要
人工智能(AI)已深入多个科学领域,为各类任务提供了相较现有算法的惊人改进。近年来,人们对 AI 技术可信性的严重担忧不断涌现。科学界聚焦于可信 AI 算法的开发。然而,当今 AI 领域流行的机器与深度学习算法高度依赖其开发所使用的数据。这些学习算法在数据中发现模式,习得行为目标。数据中的任何缺陷都可能直接转化为算法中的缺陷。本研究中,我们讨论责任式机器学习数据集的重要性,并提出通过责任式评估准则评价数据集的框架。现有工作侧重于对算法可信性的事后评估,而我们提供的框架将数据组件单独考量以理解其在算法中的作用。我们通过公平性、隐私性和监管合规的视角讨论责任式数据集,并为构建未来数据集提供建议。在调查超过 100 个数据集后,我们使用其中 60 个进行分析,表明这些数据集无一能免于公平性、隐私保护和监管合规方面的问题。我们对“datasheets for datasets”进行了修改,增加了重要内容以改进数据集文档。随着世界各国规范化数据保护法律,科学界创建数据集的方法亟需修订。我们认为本研究在当今 AI 时代及时且切题。
引用
@article{arxiv.2310.15848,
title = {On Responsible Machine Learning Datasets with Fairness, Privacy, and Regulatory Norms},
author = {Surbhi Mittal and Kartik Thakral and Richa Singh and Mayank Vatsa and Tamar Glaser and Cristian Canton Ferrer and Tal Hassner},
journal= {arXiv preprint arXiv:2310.15848},
year = {2024}
}
备注
This preprint has not undergone any post-submission improvements or corrections. The Version of Record of this article is published in Nature Machine Intelligence and is available online at https://doi.org/10.1038/s42256-024-00874-y