中文

CLIBE:检测 Transformer 基于 NLP 模型中的动态后门

密码学与安全 2024-09-12 v2 计算与语言 机器学习

摘要

后门可以被植入 NLP 模型中,以在输入文本包含特定特征(即触发器)时引发不正常行为,而攻击者会秘密选择这些触发器。与使用固定单词、短语或句子的静态文本触发器不同,NLP 动态后门攻击设计与抽象且潜在文本特征相关的触发器,使其比传统静态后门攻击更隐蔽。然而,现有研究主要聚焦于防御静态后门攻击,而针对 NLP 模型中动态后门的检测仍属未充分探索的领域。本文提出 CLIBE,首个能够检测 Transformer 基于 NLP 模型中动态后门的框架。 CLIBE 通过在注意力层中制造优化权重扰动来注入“少量扰动”,从而使扰动模型将有限数量的参考样本分类为目标标签。随后,CLIBE 利用这种少量扰动的泛化能力来确定原始模型是否包含动态后门。在三个高级 NLP 动态后门攻击、两个广泛使用的 Transformer 框架以及四个真实世界的分类任务上进行的广泛评估强有力地验证了 CLIBE 的有效性。我们还展示了 CLIBE 对各种自适应攻击的鲁棒性。此外,我们利用 CLIBE 审查了 Hugging Face 上 49 个流行的 Transformer 模型,发现其中有一个模型存在高度概率包含动态后门的可能性。我们已与 Hugging Face 联系,并提供了该模型后门行为的详细证据。此外,我们将 CLIBE 扩展到检测被修改以 exhibit 有毒行为的文本生成模型中的后门。就目前而言,CLIBE 是首个能够在不访问触发输入测试样本的情况下检测文本生成模型后门的框架。

关键词

引用

@article{arxiv.2409.01193,
  title  = {CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models},
  author = {Rui Zeng and Xi Chen and Yuwen Pu and Xuhong Zhang and Tianyu Du and Shouling Ji},
  journal= {arXiv preprint arXiv:2409.01193},
  year   = {2024}
}

备注

To appear in the Network and Distributed System Security (NDSS) Symposium, February, 2025