中文

BadChain:针对大语言模型的思维链后门提示攻击

密码学与安全 2024-01-24 v1 机器学习

摘要

大语言模型 (LLM) 已被证明能从思维链 (COT) 提示中获益,尤其是在处理需要系统推理过程的任务时。另一方面,COT 提示也以后门攻击的形式带来了新的漏洞,即模型在推理过程中,会在特定的后门触发条件下输出非预期的恶意内容。传统的后门攻击方法要么涉及用带有后门的实例污染训练数据集,要么在部署期间直接操纵模型参数。然而,这些方法对于通常通过 API 访问运行的商业 LLM 来说并不实用。在本文中,我们提出了 BadChain,这是首个针对使用 COT 提示的 LLM 的后门攻击,它无需访问训练数据集或模型参数,且计算开销低。BadChain 利用 LLM 固有的推理能力,在模型输出的推理步骤序列中插入一个后门推理步骤,从而在查询提示中存在后门触发器时改变最终响应。通过实验,我们展示了 BadChain 在四种 LLM(Llama2、GPT-3.5、PaLM2 和 GPT-4)及六项涵盖算术、常识和符号推理的复杂基准任务上对两种 COT 策略的有效性。此外,我们表明,具有更强推理能力的 LLM 对 BadChain 表现出更高的易感性,例如在 GPT-4 的六项基准任务上,平均攻击成功率高达 97.0%。最后,我们提出了两种基于打乱顺序的防御方法,并证明了它们对 BadChain 总体无效。因此,BadChain 仍然是对 LLM 的严重威胁,凸显了开发鲁棒且有效的未来防御措施的紧迫性。

关键词

引用

@article{arxiv.2401.12242,
  title  = {BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models},
  author = {Zhen Xiang and Fengqing Jiang and Zidi Xiong and Bhaskar Ramasubramanian and Radha Poovendran and Bo Li},
  journal= {arXiv preprint arXiv:2401.12242},
  year   = {2024}
}

备注

Accepted to ICLR2024