面向语言模型上下文学习的后门攻击
密码学与安全
2023-07-28 v1
摘要
由于最先进的语言模型训练成本高昂,多数从业者必须使用少数公开可用的语言模型或语言模型 API 之一。这种信任的集中增加了后门攻击的威力,即 adversary 篡改机器学习模型以使其在包含预定义后门触发器的输入上表现出某种恶意行为。我们表明,大语言模型的上下文学习能力显著复杂化了开发后门攻击的问题,因为成功的后门必须对各种提示策略有效,且不应影响模型的通用能力。我们设计了一种新攻击,用于在语言模型被提示执行特定目标任务时引发定向误分类,并通过后门植入多个规模从 13 亿到 60 亿参数的大语言模型证明了该攻击的可行性。最后我们研究减轻攻击潜在危害的防御:例如,在白盒设定下,我们表明对模型微调少至 500 步即足以移除后门行为,而在黑盒设定下,我们未能开发出仅依赖提示工程的成功防御。
引用
@article{arxiv.2307.14692,
title = {Backdoor Attacks for In-Context Learning with Language Models},
author = {Nikhil Kandpal and Matthew Jagielski and Florian Tramèr and Nicholas Carlini},
journal= {arXiv preprint arXiv:2307.14692},
year = {2023}
}
备注
AdvML Frontiers Workshop 2023