KL3M 数据项目:面向大语言模型的版权清洁训练资源
计算与语言
2025-04-11 v1 人工智能
摘要
几乎所有大语言模型都在受全球版权侵权和违约不确定性影响的数据上进行了预训练。这种不确定的法律地位给用户和开发者带来了潜在风险。KL3M 数据项目通过引入最大规模的综合训练数据流水线,直接应对这一关键问题,该流水线将版权或违约相关风险降至最低。该项目的基础是一个包含超过 1.32 亿份文档和数万亿个 token 的语料库,涵盖 16 个不同的来源,这些来源已被验证符合本文详述的严格版权和许可协议。我们将发布整个流水线,包括:1) 获取和处理这些文档的源代码;2) 带有相关来源和元数据的原始文档格式;3) 标准化格式的提取内容;4) 文档的预分词表示;5) 各种训练中与训练后资源,如问答、摘要、转换、起草、分类、预测和对话数据。所有这些资源均根据 CC-BY 条款在 S3、Hugging Face 和 GitHub 上向公众免费提供。我们致力于继续推进该项目,以促进更具道德、合法和可持续性的 AI 模型开发与使用方法。
引用
@article{arxiv.2504.07854,
title = {The KL3M Data Project: Copyright-Clean Training Resources for Large Language Models},
author = {Michael J Bommarito and Jillian Bommarito and Daniel Martin Katz},
journal= {arXiv preprint arXiv:2504.07854},
year = {2025}
}
备注
27 pages, 7 figures, 9 table