旋转语言模型:宣传即服务的威胁与对策
密码学与安全
2022-10-12 v2 计算与语言
机器学习
摘要
我们研究了一种针对神经序列到序列(seq2seq)模型的新威胁:训练时攻击使模型“旋转”其输出,以支持攻击者选定的情感或观点——但仅当输入包含攻击者选定的触发词时。例如,一个被旋转的摘要模型会对任何提及某个人或组织名称的文本输出正面摘要。模型旋转向模型中引入了“元后门”。常规后门使模型在带触发词的输入上产生错误输出,而被旋转模型的输出保留上下文并维持标准准确率指标,同时还满足攻击者选定的元任务。模型旋转实现了宣传即服务,其中宣传被定义为有偏见的言论。攻击者可创建定制语言模型,对选定触发词产生期望的旋转,随后部署这些模型以生成虚假信息(平台攻击),或将其注入 ML 训练流水线(供应链攻击),将恶意功能迁移至受害者训练出的下游模型。为证明模型旋转的可行性,我们开发了一种新后门技术。它将对抗性元任务叠加到 seq2seq 模型上,将期望的元任务输出反向传播至我们称为“伪词”的词嵌入空间中的点,并利用伪词偏移 seq2seq 模型的整个输出分布。我们在语言生成、摘要和翻译模型上以不同触发词及情感、毒性和蕴含等元任务评估了该攻击。被旋转模型在大幅维持其准确率指标(ROUGE 和 BLEU)的同时,将输出偏移以满足攻击者的元任务。我们还表明,在供应链攻击情形下,旋转功能会迁移至下游模型。
引用
@article{arxiv.2112.05224,
title = {Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures},
author = {Eugene Bagdasaryan and Vitaly Shmatikov},
journal= {arXiv preprint arXiv:2112.05224},
year = {2022}
}
备注
IEEE S&P 2022. arXiv admin note: text overlap with arXiv:2107.10443