中文

LicenseGPT:面向公开数据集许可证合规性的微调基础模型

软件工程 2026-05-08 v2 人工智能

摘要

数据集许可证合规性是开发商业AI产品中一个关键但复杂的方面,尤其是在公开数据集使用日益增加的背景下。数据集许可证的模糊性带来了显著的法律风险,即使对于软件知识产权律师来说,准确解释权利和义务也具有挑战性。在本文中,我们介绍了LicenseGPT,一个专门为数据集许可证合规性分析而微调的基础模型(FM)。我们首先评估了现有的法律基础模型(即专门用于理解和处理法律文本的基础模型),发现表现最佳的模型预测一致性(PA)仅为43.75%。LicenseGPT在由法律专家标注的500个许可证的精选数据集上微调,将PA显著提升至64.30%,优于法律和通用基础模型。通过与软件知识产权律师进行的A/B测试和用户研究,我们证明LicenseGPT将分析时间减少了94.44%,从每个许可证108秒降至6秒,且不牺牲准确性。软件知识产权律师认为LicenseGPT是一个有价值的辅助工具,提高了效率,同时承认在复杂情况下需要人工监督。我们的工作强调了专业AI工具在法律实践中的潜力,并为从业者和研究人员提供了公开可用的资源。

关键词

引用

@article{arxiv.2501.00106,
  title  = {LicenseGPT: A Fine-tuned Foundation Model for Publicly Available Dataset License Compliance},
  author = {Jingwen Tan and Gopi Krishnan Rajbahadur and Zi Li and Xiangfu Song and Jianshan Lin and Dan Li and Zibin Zheng and Ahmed E. Hassan},
  journal= {arXiv preprint arXiv:2501.00106},
  year   = {2026}
}