中文

面向LLM训练开放数据集的最佳实践

计算机与社会 2025-01-16 v1 人工智能 计算与语言 机器学习

摘要

许多AI公司正在未经版权所有者许可的情况下,使用数据训练其大型语言模型(LLM)。这种做法的允许性因司法管辖区而异:在欧盟和日本等国家,在一定限制下是允许的,而在美国,法律环境则更加模糊。无论法律地位如何,创意生产者的担忧已导致多起备受瞩目的版权诉讼,诉讼威胁常被引为近期企业和公共利益行为者尽量减少训练数据集信息共享趋势的原因。这种限制数据信息的趋势通过拒绝研究人员、审计人员和受影响个体获取理解AI模型所需的信息,损害了更广泛生态系统中的透明度、问责制和创新能力。虽然可以通过在开放获取和公共领域数据上训练语言模型来缓解这一问题,但在撰写本文时,由于组装必要语料库面临巨大的技术和社会挑战,尚不存在此类模型(以有意义的规模训练)。这些挑战包括不完整且不可靠的元数据、数字化物理记录的成本和复杂性,以及在快速变化的环境中确保相关性和责任性所需的各种法律和技术技能。要构建一个AI系统能够在开放许可数据上训练、且数据得到负责任管理和治理的未来,需要法律、技术和政策领域的合作,以及对元数据标准、数字化和培养开放文化的投入。

关键词

引用

@article{arxiv.2501.08365,
  title  = {Towards Best Practices for Open Datasets for LLM Training},
  author = {Stefan Baack and Stella Biderman and Kasia Odrozek and Aviya Skowron and Ayah Bdeir and Jillian Bommarito and Jennifer Ding and Maximilian Gahntz and Paul Keller and Pierre-Carl Langlais and Greg Lindahl and Sebastian Majstorovic and Nik Marda and Guilherme Penedo and Maarten Van Segbroeck and Jennifer Wang and Leandro von Werra and Mitchell Baker and Julie Belião and Kasia Chmielinski and Marzieh Fadaee and Lisa Gutermuth and Hynek Kydlíček and Greg Leppert and EM Lewis-Jong and Solana Larsen and Shayne Longpre and Angela Oduor Lungati and Cullen Miller and Victor Miller and Max Ryabinin and Kathleen Siminyu and Andrew Strait and Mark Surman and Anna Tumadóttir and Maurice Weber and Rebecca Weiss and Lee White and Thomas Wolf},
  journal= {arXiv preprint arXiv:2501.08365},
  year   = {2025}
}