合规评级方案:面向生成式 AI 数据集的数据溯源框架
人工智能
2025-12-29 v1 计算机与社会
数据库
摘要
生成式人工智能 (GAI) 近年来经历了指数级增长,部分得益于大规模开源数据集的丰富。这些数据集通常使用不受限制且不透明的数据收集实践构建。尽管大多数文献关注 GAI 模型的开发与应用,但围绕这些数据集创建的伦理和法律考量往往被忽视。此外,随着数据集在线共享、编辑和进一步复制,关于其来源、合法性和安全性的信息往往会丢失。为了填补这一空白,我们引入了合规评级方案 (CRS),这是一个旨在评估数据集是否符合关键透明度、问责制和安全性原则的框架。我们还发布了一个围绕数据溯源技术构建的开源 Python 库来实现该框架,允许其无缝集成到现有的数据处理和 AI 训练流程中。该库同时具有反应性和主动性,因为除了评估现有数据集的 CRS 外,它同样能指导负责任地抓取和构建新数据集。
引用
@article{arxiv.2512.21775,
title = {Compliance Rating Scheme: A Data Provenance Framework for Generative AI Datasets},
author = {Matyas Bohacek and Ignacio Vilanova Echavarri},
journal= {arXiv preprint arXiv:2512.21775},
year = {2025}
}