中文

SynGhost:通过句法转移实现的不可见且通用的任务无关后门攻击

密码学与安全 2025-03-04 v4 人工智能 计算与语言

摘要

尽管预训练取得了显著性能,但由于数据和训练机制的漏洞,它容易受到任务无关后门攻击的影响。这些攻击可以将后门转移到各种下游任务中。在本文中,我们引入了 maxEntropy\mathtt{maxEntropy},一种基于熵的投毒过滤器,以减轻此类风险。为了克服手动设置目标和显式触发器的局限性,我们提出了 SynGhost\mathtt{SynGhost},这是一种通过句法转移实现的不可见且通用的任务无关后门攻击,进一步暴露了预训练语言模型 (PLMs) 的漏洞。具体而言,SynGhost\mathtt{SynGhost} 通过语料库投毒将多个句法后门注入预训练空间,同时保留 PLM 的预训练能力。其次,SynGhost\mathtt{SynGhost} 基于对比学习自适应地选择最优目标,在预训练空间中创建均匀分布。为了识别句法差异,我们还引入了一个感知模块,以最小化后门之间的干扰。实验表明,SynGhost\mathtt{SynGhost} 构成了重大威胁,并且可以转移到各种下游任务。此外,SynGhost\mathtt{SynGhost} 能够抵抗基于困惑度、精细剪枝 (fine-pruning) 和 maxEntropy\mathtt{maxEntropy} 的防御。代码可在 https://github.com/Zhou-CyberSecurity-AI/SynGhost 获取。

关键词

引用

@article{arxiv.2402.18945,
  title  = {SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer},
  author = {Pengzhou Cheng and Wei Du and Zongru Wu and Fengwei Zhang and Libo Chen and Zhuosheng Zhang and Gongshen Liu},
  journal= {arXiv preprint arXiv:2402.18945},
  year   = {2025}
}

备注

17 pages, 16 figures, 12 tables, accepted at NAACL 2025 Findings