NLP中基于输入唯一触发器的后门攻击
计算与语言
2023-03-28 v1
摘要
后门攻击旨在诱导神经模型对投毒数据做出错误预测,同时保持其在干净数据集上的预测不变,这对当前自然语言处理(NLP)系统构成了相当大的威胁。现有的后门攻击系统面临两个严重问题:首先,大多数后门触发器遵循统一且通常独立于输入的范式,例如插入特定触发词、同义词替换。这显著削弱了攻击模型的隐蔽性,导致训练出的后门模型容易被模型探针识别为恶意模型。其次,插入触发器的投毒句子通常不通顺、不合语法,甚至改变了原句语义,使其在预处理阶段容易被过滤。为解决这两个问题,本文提出一种输入唯一的后门攻击(NURA),为输入生成独有的后门触发器。IDBA通过用GPT2等语言模型对输入进行续写来生成上下文相关触发器,生成的句子即作为后门触发器。该策略不仅创建了输入唯一的后门触发器,还保留了原始输入的语义,同时解决了上述两个问题。实验结果表明,IDBA攻击有效且难以防御:它在所有广泛使用的基准上都实现了高攻击成功率,且对现有防御方法免疫。此外,它能生成流畅、合乎语法且多样的后门输入,几乎无法通过人工检查识别。
引用
@article{arxiv.2303.14325,
title = {Backdoor Attacks with Input-unique Triggers in NLP},
author = {Xukun Zhou and Jiwei Li and Tianwei Zhang and Lingjuan Lyu and Muqiao Yang and Jun He},
journal= {arXiv preprint arXiv:2303.14325},
year = {2023}
}