AI 的数据真实性、同意与来源均已被破坏:修复它们需要什么?
人工智能
2024-09-04 v2 计算机与社会
摘要
基础模型的新能力在很大程度上归功于海量、来源广泛且缺乏文档记录的训练数据集。现有的数据收集实践导致在追溯真实性、验证同意、保护隐私、解决表征与偏见、尊重版权以及整体开发合乎伦理且可信的基础模型方面面临诸多挑战。作为回应,监管正强调训练数据透明的必要性,以理解基础模型的局限性。基于对基础模型训练数据格局和现有解决方案的大规模分析,我们识别了缺失的基础设施以促进负责任的基础模型开发实践。我们审视了现有数据真实性、同意和文档追溯工具的当前缺陷,并概述了政策制定者、开发者和数据创建者如何通过采用通用数据来源标准来促进负责任的基础模型开发。
引用
@article{arxiv.2404.12691,
title = {Data Authenticity, Consent, & Provenance for AI are all broken: what will it take to fix them?},
author = {Shayne Longpre and Robert Mahari and Naana Obeng-Marnu and William Brannon and Tobin South and Katy Gero and Sandy Pentland and Jad Kabbara},
journal= {arXiv preprint arXiv:2404.12691},
year = {2024}
}
备注
ICML 2024 camera-ready version (Spotlight paper). 9 pages, 2 tables