通过对抗式上下文学习劫持大语言模型
机器学习
2025-05-30 v3 计算与语言
密码学与安全
摘要
上下文学习(ICL)已成为一种利用 LLM 完成特定下游任务的强大范式,其通过在预处理提示中使用带标签示例作为演示(demos)来实现。尽管性能可观,精心设计的对抗攻击对 LLM 的鲁棒性构成显著威胁。现有攻击或易于检测,或需在用户输入中设置触发器,或缺乏针对 ICL 的特异性。为解决这些问题,本文提出一种新颖的、可迁移的针对 ICL 的提示注入攻击,旨在劫持 LLM 生成目标输出或引发有害响应。在我们的威胁模型中,黑客充当模型发布者,利用基于梯度的提示搜索方法学习并通过提示注入将难以察觉的对抗后缀附加到上下文演示中。我们还提出使用少量干净演示的有效防御策略,以增强 LLM 在 ICL 期间的鲁棒性。跨多种分类与越狱任务的广泛实验结果证明了所提攻击与防御策略的有效性。本工作凸显了 LLM 在 ICL 期间的重大安全漏洞,并强调需进一步深入研究。
引用
@article{arxiv.2311.09948,
title = {Hijacking Large Language Models via Adversarial In-Context Learning},
author = {Xiangyu Zhou and Yao Qiang and Saleh Zare Zade and Prashant Khanduri and Dongxiao Zhu},
journal= {arXiv preprint arXiv:2311.09948},
year = {2025}
}