揭示 LLM 中的预训练代码:基于语法感知的归因方法
密码学与安全
2025-11-11 v1
摘要
随着大型语言模型(LLM)日益强大,关于其训练数据中未经授权使用受版权保护和许可内容的担忧日益增长,尤其是在代码的背景下。开源代码通常受开源许可证(如 GPL)保护,在预训练中使用其未经授权使用 presents 法律和伦理挑战。检测特定代码样本是否包含在 LLM 训练数据中对于透明度、问责制和版权合规性至关重要。我们提出了 SynPrune,一种针对代码的语法修剪成员推断攻击方法。与先前的 MIA 方法将代码视为纯文本不同,SynPrune 利用编程语言的结构化和规则导向特性。具体而言,它识别并排除在归因计算中对归属性贡献不大的随机所需标记。实验结果表明,SynPrune consistently 优于最新方法。该方法在不同函数长度和语法类别之间也具有鲁棒性。
引用
@article{arxiv.2511.07033,
title = {Uncovering Pretraining Code in LLMs: A Syntax-Aware Attribution Approach},
author = {Yuanheng Li and Zhuoyang Chen and Xiaoyun Liu and Yuhao Wang and Mingwei Liu and Yang Shi and Kaifeng Huang and Shengjie Zhao},
journal= {arXiv preprint arXiv:2511.07033},
year = {2025}
}
备注
Paper has been accepted by AAAI 2026