面向大语言模型的对抗性示例攻击
计算与语言
2023-10-17 v2 人工智能
密码学与安全
机器学习
摘要
随着更强大的大语言模型(LLM)(如 ChatGPT 与 GPT-4)的出现,上下文学习(ICL)通过利用数据-标签对作为前置提示来将这些模型用于特定任务,已变得极为重要。尽管加入示例可大幅提升 LLM 在各类任务上的表现,但也可能引入新的安全隐忧:攻击者仅操纵示例而不改变输入即可发起攻击。本文从对抗视角研究 ICL 的安全问题,聚焦于示例的影响。我们提出一种名为 advICL 的新攻击方法,旨在仅操纵示例而不改变输入以误导模型。我们的结果表明,随着示例数量增加,上下文学习的鲁棒性会下降。此外,我们还识别出示例的内在属性:其可与不同输入一起使用(前置)。这由此引入了一种更实际的威胁模型,其中攻击者可攻击测试输入样本,即便不知晓且未操纵该样本。为实现此目标,我们提出 advICL 的可迁移版本,名为 Transferable-advICL。我们的实验显示,由 Transferable-advICL 生成的对抗示例可成功攻击未见的测试输入样本。我们希望本研究揭示与 ICL 相关的关键安全风险,并强调亟需对 ICL 鲁棒性开展广泛研究,尤其考虑到其在 LLM 发展中的日益重要性。
引用
@article{arxiv.2305.14950,
title = {Adversarial Demonstration Attacks on Large Language Models},
author = {Jiongxiao Wang and Zichen Liu and Keun Hee Park and Zhuojun Jiang and Zhaoheng Zheng and Zhuofeng Wu and Muhao Chen and Chaowei Xiao},
journal= {arXiv preprint arXiv:2305.14950},
year = {2023}
}