中文

基于对抗提示的代码完成模型有效代码成员推断

广义相对论与量子宇宙学 2025-11-20 v1

摘要

代码完成模型的成员推断攻击(MIAs)通过推断给定代码片段是否为训练数据的成员来评估其隐私风险。现有黑盒和灰盒 MIAs 依赖高昂的替代模型或手动构建的启发式规则,这限制了其捕捉过参数化代码语言模型所表现出的细粒度记忆模式的能力。为此,我们提出针对代码完成模型设计的 AdvPrompt-MIA 方法,结合代码特定的对抗扰动与深度学习。我们方法的核心创新点在于设计一系列对抗提示,以诱使受害代码模型的输出产生变化。通过将这些输出与真实完成结果进行比较,我们构建特征向量以训练分类器,自动区分成员样本与非成员样本。这种设计允许我们捕捉更丰富的记忆模式并准确推断训练集成员身份。在广泛采用的 Code Llama 7B 等模型上进行全面评估,结果表明我们的方法在 AUC 上 consistently 超过最先进的基线,提升幅度可达 102%。此外,我们的方法在不同模型和数据集之间表现出强大的可迁移性,凸显了其实际实用性和通用性。

关键词

引用

@article{arxiv.2511.15106,
  title  = {Near-horizon geometry with torsion: Kerr-AdS black hole},
  author = {B. Cvetković and D. Rakonjac},
  journal= {arXiv preprint arXiv:2511.15106},
  year   = {2025}
}

备注

LaTeX, 19 pages