中文

合规评级方案:面向生成式 AI 数据集的数据溯源框架

人工智能 2025-12-29 v1 计算机与社会 数据库

摘要

生成式人工智能 (GAI) 近年来经历了指数级增长,部分得益于大规模开源数据集的丰富。这些数据集通常使用不受限制且不透明的数据收集实践构建。尽管大多数文献关注 GAI 模型的开发与应用,但围绕这些数据集创建的伦理和法律考量往往被忽视。此外,随着数据集在线共享、编辑和进一步复制,关于其来源、合法性和安全性的信息往往会丢失。为了填补这一空白,我们引入了合规评级方案 (CRS),这是一个旨在评估数据集是否符合关键透明度、问责制和安全性原则的框架。我们还发布了一个围绕数据溯源技术构建的开源 Python 库来实现该框架,允许其无缝集成到现有的数据处理和 AI 训练流程中。该库同时具有反应性和主动性,因为除了评估现有数据集的 CRS 外,它同样能指导负责任地抓取和构建新数据集。

关键词

引用

@article{arxiv.2512.21775,
  title  = {Compliance Rating Scheme: A Data Provenance Framework for Generative AI Datasets},
  author = {Matyas Bohacek and Ignacio Vilanova Echavarri},
  journal= {arXiv preprint arXiv:2512.21775},
  year   = {2025}
}