中文

LiCoEval:评估 LLM 在代码生成中的许可证合规性

软件工程 2025-02-26 v3 人工智能 机器学习

摘要

近期大型语言模型(LLM)的进展彻底改变了代码生成领域,导致开发人员广泛采用 AI 编码工具。然而,LLM 可以在不提供必要许可证信息的情况下生成受许可保护的代码,从而在软件开发期间导致潜在的知识产权侵犯。这篇论文解决了 LLM 生成代码许可证合规性的关键且尚未充分探讨的问题,通过建立一个基准来评估 LLM 提供准确许可证信息的能力。为了建立此基准,我们进行经验研究,确定一种合理的“ striking similarity”(显著相似)标准,以排除独立创建的可能性,表明 LLM 输出与某些已有开源代码之间存在复制关系。基于此标准,我们提出 LiCoEval 来评估 LLM 的许可证合规性,即在生成与已有受版权保护代码显著相似的 code 时,LLM 能否提供准确的许可证或版权信息。使用 LiCoEval,我们评估了 14 个流行的 LLM,发现即使是表现最好的 LLM 也会产生 0.88% 到 2.01% 的代码显著类似于现有开源实现的比例。值得注意的是,大多数 LLM 未能提供准确的许可证信息,尤其是针对 copyleft 许可证的代码。这凸显了在代码生成任务中增强 LLM 合规性能力的紧迫需求。我们的研究为未来研究和开发提供了基础,以提高 AI 辅助软件开发中的许可证合规性,既有助于保护开源软件版权,也有助于缓解 LLM 使用者的法律风险。

关键词

引用

@article{arxiv.2408.02487,
  title  = {LiCoEval: Evaluating LLMs on License Compliance in Code Generation},
  author = {Weiwei Xu and Kai Gao and Hao He and Minghui Zhou},
  journal= {arXiv preprint arXiv:2408.02487},
  year   = {2025}
}

备注

The 47th International Conference on Software Engineering(ICSE 2025)