中文

大型语言模型中版权材料的影响:挪威语视角

计算与语言 2025-01-27 v4

摘要

在训练语言模型时使用受版权保护的材料引发了重要的法律和伦理问题。本文提出了一套框架,并呈现了对挪威语大型生成语言模型(LLM)性能受发行商控制的受版权保护语料库影响的实证评估结果。在一组多样化任务上进行评估时,我们发现,无论是书籍还是报纸的添加,都倾向于提高模型性能,而小说作品的添加则似乎适得其反。我们的实验结果可为为为其作品贡献于人工智能发展的作者设立补偿方案提供参考。

关键词

引用

@article{arxiv.2412.09460,
  title  = {The Impact of Copyrighted Material on Large Language Models: A Norwegian Perspective},
  author = {Javier de la Rosa and Vladislav Mikhailov and Lemei Zhang and Freddy Wetjen and David Samuel and Peng Liu and Rolv-Arild Braaten and Petter Mæhlum and Magnus Breder Birkenes and Andrey Kutuzov and Tita Enstad and Hans Christian Farsethås and Svein Arne Brygfjeld and Jon Atle Gulla and Stephan Oepen and Erik Velldal and Wilfred Østgulen and Liljia Øvrelid and Aslak Sira Myhre},
  journal= {arXiv preprint arXiv:2412.09460},
  year   = {2025}
}

备注

17 pages, 5 figures, 8 tables. Accepted at NoDaLiDa/Baltic-HLT 2025