探索 AI 编码器中的训练数据检测
软件工程
2025-07-24 v1 人工智能
摘要
代码大型语言模型 (CodeLLM) 的近期进步使其成为现代软件工程中不可或缺的工具。然而,这些模型偶尔会生成包含专有或敏感代码片段的输出,这引发了关于潜在非合规使用训练数据、以及对隐私和知识产权构成风险的担忧。为确保 CodeLLM 的负责任合规部署,训练数据检测 (TDD) 已成为关键任务。虽然近期的 TDD 方法在自然语言场景中表现有前景,但其在代码数据上的有效性仍大体未被探索。这种差距尤为重要,因为代码的结构化语法与自然语言的不同相似性标准不同。为此,我们对七种最先进的 TDD 方法在源代码数据上的表现进行了全面实证研究,评估了其在八个 CodeLLM 上的表现。为支持此评估,我们引入 CodeSnitch,一个函数级别的基准数据集,包含 9000 个三种编程语言的代码样本,每个样本均明确标记为包含或不包含在 CodeLLM 训练数据中。除在原始 CodeSnitch 上的评估外,我们设计了针对性的突变策略,以测试 TDD 方法在三个不同设置下的鲁棒性。这些突变策略基于众所周知的 Type-1 至 Type-4 代码克隆检测分类法。我们的研究为代码当前 TDD 技术的系统性评估提供了依据,并为未来开发更有效和更稳健的检测方法提供了见解。
引用
@article{arxiv.2507.17389,
title = {Investigating Training Data Detection in AI Coders},
author = {Tianlin Li and Yunxiang Wei and Zhiming Li and Aishan Liu and Qing Guo and Xianglong Liu and Dongning Sun and Yang Liu},
journal= {arXiv preprint arXiv:2507.17389},
year = {2025}
}