TrojText:测试时不可见文本木马插入
计算与语言
2023-08-23 v2
摘要
在自然语言处理(NLP)中,智能神经元模型易遭受文本木马攻击。此类攻击发生于木马模型对标准输入表现正常,但对含有特定触发器的输入产生恶意输出时。句法结构触发器不可见,因难以检测与防御,正日益流行于木马攻击。然而,这类攻击需要大量训练语料来生成具有必要句法结构的投毒样本以插入木马。攻击者获取此类数据可能困难,且生成句法投毒触发器与插入木马的过程耗时。本文提出一种称为 TrojText 的解决方案,旨在确定能否在无训练数据情况下更高效且低成本地执行不可见文本木马攻击。所提方法称为表示-对数木马插入(RLI)算法,使用较小的采样测试数据而非大量训练数据来实现所需攻击。本文还引入两种附加技术,即累积梯度排序(AGR)与木马权重剪枝(TWP),以减少调参数量与攻击开销。TrojText 方法在三个数据集(AG's News、SST-2 和 OLID)上使用三种 NLP 模型(BERT、XLNet 和 DeBERTa)进行了评估。实验表明,在 AG's News 数据集上,TrojText 方法在 BERT 模型上针对目标类的测试句子实现了 98.35% 的分类准确率。TrojText 的源代码见 https://github.com/UCF-ML-Research/TrojText。
引用
@article{arxiv.2303.02242,
title = {TrojText: Test-time Invisible Textual Trojan Insertion},
author = {Qian Lou and Yepeng Liu and Bo Feng},
journal= {arXiv preprint arXiv:2303.02242},
year = {2023}
}
备注
In The Eleventh International Conference on Learning Representations. 2023 (ICLR 2023)