用元后门旋转序列到序列模型
密码学与安全
2022-10-12 v2 计算与语言
机器学习
摘要
我们研究了对神经序列到序列(seq2seq)模型的一种新威胁:训练时攻击使模型在输入包含攻击者选定的触发词时“旋转”其输出并支持某种情感。例如,任何提及某个人或组织名称的文本,摘要模型都会输出正面摘要。我们引入“元后门”概念来解释模型旋转攻击。这些攻击产生的模型输出有效且保留上下文,同时满足攻击者选择的元任务(如正面情感)。先前研究的语言模型后门仅翻转情感标签或罔顾上下文地替换词,其输出在含触发词的输入上是不正确的。相反,元后门是首类可部署于seq2seq模型以(a)向输出中引入攻击者选定的旋转,同时(b)保持标准精度指标的后门。为证明模型旋转的可行性,我们开发了一种新后门技术。它将对抗元任务(如情感分析)叠加到seq2seq模型上,将期望的元任务输出(如正面情感)反向传播至词嵌入空间中我们称为“伪词”的点,并利用伪词偏移seq2seq模型的整个输出分布。使用流行、较不流行和全新专有名词作为触发器,我们在BART摘要模型上评估该技术,表明其在保持输出ROUGE分数的同时显著改变情感。我们解释了模型旋转为何在AI驱动的错误信息中是危险技术,并讨论如何缓解这些攻击。
引用
@article{arxiv.2107.10443,
title = {Spinning Sequence-to-Sequence Models with Meta-Backdoors},
author = {Eugene Bagdasaryan and Vitaly Shmatikov},
journal= {arXiv preprint arXiv:2107.10443},
year = {2022}
}
备注
Outdated. Superseded by arXiv:2112.05224 and published at IEEE S&P'22 with title: "Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures"