面向大语言模型的目标引导生成式提示注入攻击
密码学与安全
2024-11-12 v4 人工智能
计算与语言
摘要
当前的大语言模型(LLM)为大规模面向用户的自然语言任务提供了坚实基础。大量用户可以通过用户界面轻易注入对抗性文本或指令,从而引发LLM模型的安全挑战。尽管目前已有大量关于提示注入攻击的研究,但这些黑盒攻击大多采用启发式策略。目前尚不清楚这些启发式策略与攻击成功率之间的关系,从而无法有效提升模型鲁棒性。为解决此问题,我们重新定义了攻击目标:最大化干净文本与对抗文本条件概率之间的KL散度。此外,我们证明当条件概率为高斯分布时,最大化KL散度等价于最大化干净文本与对抗文本的嵌入表示x和x'之间的马氏距离,并给出了关于x和x'的定量关系。然后,我们设计了一种简单有效的目标引导生成式提示注入策略(G2PIA),以寻找满足特定约束的注入文本,从而近似达到最优攻击效果。特别值得注意的是,我们的攻击方法是一种低计算成本的无查询黑盒攻击方法。在七个LLM模型和四个数据集上的实验结果表明了我们攻击方法的有效性。
引用
@article{arxiv.2404.07234,
title = {Goal-guided Generative Prompt Injection Attack on Large Language Models},
author = {Chong Zhang and Mingyu Jin and Qinkai Yu and Chengzhi Liu and Haochen Xue and Xiaobo Jin},
journal= {arXiv preprint arXiv:2404.07234},
year = {2024}
}
备注
11 pages, 6 figures