中文

AST-PAC:基于 AST 的成员推断攻击

人工智能 2026-02-17 v1 软件工程

摘要

代码大型语言模型经常在包含受限许可证源代码的大型数据集上进行训练。这造成了迫切的数据治理和版权挑战。成员推断攻击(MIAs)可作为检测模型中未授权数据使用的审计机制。虽然损失攻击提供了基线,但类似于极化增强校准(PAC)等更复杂的方法在代码领域仍鲜有探索。本文对这些方法在 3B--7B 参数代码模型上进行了探索性研究。我们发现,尽管 PAC 通常优于损失基线,其有效性依赖于忽视代码刚性语法的增强策略,导致在大型复杂文件上性能下降。为此,我们引入 AST-PAC,一种基于抽象语法树(AST)的领域特定适应方法,用于生成语法有效的校准样本。初步结果表明,AST-PAC 在语法规模增大时表现提升,而 PAC 则恶化;但在小文件方面可能过度变异,在含字母数字内容丰富的代码上表现不佳。总体而言,本研究的发现动员了未来在语法感知和规模自适应校准方面的工作,这是可靠的��드语言模型源信息审计的前提条件。

关键词

引用

@article{arxiv.2602.13240,
  title  = {AST-PAC: AST-guided Membership Inference for Code},
  author = {Roham Koohestani and Ali Al-Kaswan and Jonathan Katzy and Maliheh Izadi},
  journal= {arXiv preprint arXiv:2602.13240},
  year   = {2026}
}