SynGhost:通过句法转移实现的不可见且通用的任务无关后门攻击
密码学与安全
2025-03-04 v4 人工智能
计算与语言
摘要
尽管预训练取得了显著性能,但由于数据和训练机制的漏洞,它容易受到任务无关后门攻击的影响。这些攻击可以将后门转移到各种下游任务中。在本文中,我们引入了 ,一种基于熵的投毒过滤器,以减轻此类风险。为了克服手动设置目标和显式触发器的局限性,我们提出了 ,这是一种通过句法转移实现的不可见且通用的任务无关后门攻击,进一步暴露了预训练语言模型 (PLMs) 的漏洞。具体而言, 通过语料库投毒将多个句法后门注入预训练空间,同时保留 PLM 的预训练能力。其次, 基于对比学习自适应地选择最优目标,在预训练空间中创建均匀分布。为了识别句法差异,我们还引入了一个感知模块,以最小化后门之间的干扰。实验表明, 构成了重大威胁,并且可以转移到各种下游任务。此外, 能够抵抗基于困惑度、精细剪枝 (fine-pruning) 和 的防御。代码可在 https://github.com/Zhou-CyberSecurity-AI/SynGhost 获取。
引用
@article{arxiv.2402.18945,
title = {SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer},
author = {Pengzhou Cheng and Wei Du and Zongru Wu and Fengwei Zhang and Libo Chen and Zhuosheng Zhang and Gongshen Liu},
journal= {arXiv preprint arXiv:2402.18945},
year = {2025}
}
备注
17 pages, 16 figures, 12 tables, accepted at NAACL 2025 Findings