针对基于 BERT 模型的注意力增强后门攻击
机器学习
2023-10-26 v2
摘要
近期研究揭示,\textit{后门攻击}(Backdoor Attacks)可威胁自然语言处理(NLP)模型的安全性。调查后门攻击策略有助于理解模型的脆弱性。现有文本后门攻击多聚焦于生成隐蔽触发器或修改模型权重。本文直接针对神经网络的内部结构与后门机制。我们提出一种新颖的木马注意力损失(Trojan Attention Loss, TAL),通过直接操纵注意力模式增强木马行为。我们的损失可应用于不同攻击方法,以提升其在攻击成功率和投毒率方面的攻击效能。它既适用于传统脏标签攻击,也适用于更具挑战性的干净标签攻击。我们在不同骨干模型(BERT、RoBERTa 和 DistilBERT)和多种任务(情感分析、有毒内容检测和主题分类)上验证了我们的方法。
引用
@article{arxiv.2310.14480,
title = {Attention-Enhancing Backdoor Attacks Against BERT-based Models},
author = {Weimin Lyu and Songzhu Zheng and Lu Pang and Haibin Ling and Chao Chen},
journal= {arXiv preprint arXiv:2310.14480},
year = {2023}
}
备注
Findings of EMNLP 2023