中文

亚历山大项目:通过大语言模型摆脱科学知识的版权负担

机器学习 2025-04-21 v2 人工智能 计算与语言

摘要

付费墙、许可证和版权规则常常限制科学知识的广泛传播与复用。我们认为,从法律和技术两个层面来看,提取学术文本中的科学知识是可行的。当前方法,如文本嵌入,难以可靠地保留事实内容,简单改写可能并不具备法律效力。我们提出了社区应采纳的新想法:将学术文档转换为知识保护且与表达风格无关的表示,称为知识单元(Knowledge Units)。这些单元使用结构化数据捕获实体、属性和关系,却不包含风格化内容。我们提供的证据表明,知识单元(1)基于德国版权法和美国公平使用原则,构成了从受版权保护的科学文本中共享知识的合法可防御框架(2)保留了原文本中约 95% 的事实知识,通过在四个科学领域的事实题目表现进行评估。摆脱版权束缚的科学知识承诺带来变革性的科学研究和教育益处,使大语言模型能够复用受版权保护文本中的重要事实。为支持这一目标,我们分享了将研究文档转换为知识单元的开源工具。总体而言,我们的工作表明,在尊重版权的前提下,实现对科学知识的民主化访问是可行的。

关键词

引用

@article{arxiv.2502.19413,
  title  = {Project Alexandria: Towards Freeing Scientific Knowledge from Copyright Burdens via LLMs},
  author = {Christoph Schuhmann and Gollam Rabby and Ameya Prabhu and Tawsif Ahmed and Andreas Hochlehnert and Huu Nguyen and Nick Akinci and Ludwig Schmidt and Robert Kaczmarczyk and Sören Auer and Jenia Jitsev and Matthias Bethge},
  journal= {arXiv preprint arXiv:2502.19413},
  year   = {2025}
}

备注

Technical Report