用于检测代码预训练语言模型中未授权数据使用的代码成员推理
软件工程
2025-02-19 v2
摘要
代码预训练语言模型(CPLM)受到了广泛关注,因为它们可以有益于促进软件开发和维护的各种任务。然而,CPLM 在海量的开源代码上进行训练,引发了对潜在数据侵权的担忧。本文启动了对 CPLM 中未授权代码使用检测的研究,即代码成员推理(CMI)任务。我们为 CMI 的不同设置设计了一个框架 Buzzer。Buzzer 部署了多种推理技术,包括从预训练任务中提取信号、难学习样本校准和加权推理,以准确识别代码成员状态。大量实验表明,使用 Buzzer 可以高精度地实现 CMI。因此,Buzzer 可以作为 CMI 工具,帮助保护知识产权。
引用
@article{arxiv.2312.07200,
title = {Code Membership Inference for Detecting Unauthorized Data Use in Code Pre-trained Language Models},
author = {Sheng Zhang and Hui Li},
journal= {arXiv preprint arXiv:2312.07200},
year = {2025}
}