认证大语言模型抵御对抗性提示的安全性
计算与语言
2025-02-06 v4 人工智能
密码学与安全
机器学习
摘要
大语言模型(LLMs)易受对抗性攻击,此类攻击在输入提示中添加恶意词元以绕过 LLM 的安全护栏并使其生成有害内容。本文提出 erase-and-check(擦除-检查),这是首个提供可认证安全保证以防御对抗性提示的框架。给定提示后,我们的流程逐个擦除词元,并使用安全过滤器检查所得子序列。我们的安全证书保证:在不超过特定规模的对抗性攻击下,有害提示不会因攻击而被误标为安全。我们以两种方式实现安全过滤器,分别使用 Llama 2 和 DistilBERT,并比较了这两种情况下 erase-and-check 的性能。我们防御三种攻击模式:i) 对抗性后缀,即在有害提示末尾附加对抗性序列;ii) 对抗性插入,即在提示中间任意位置插入对抗性序列;iii) 对抗性注入,即在提示任意位置插入对抗性词元,不一定为连续块。实验结果表明,该流程能在有害提示上获得较强的可认证安全保证,同时在安全提示上保持良好的经验性能。此外,我们提出三种高效经验防御:i) RandEC,erase-and-check 的随机子采样版本;ii) GreedyEC,贪心擦除使有害类 softmax 分数最大化的词元;iii) GradEC,利用梯度信息优化待擦除词元。我们展示了它们针对 Greedy Coordinate Gradient(GCG)攻击算法生成的对抗性提示的有效性。我们的实验代码见 https://github.com/aounon/certified-llm-safety。
引用
@article{arxiv.2309.02705,
title = {Certifying LLM Safety against Adversarial Prompting},
author = {Aounon Kumar and Chirag Agarwal and Suraj Srinivas and Aaron Jiaxun Li and Soheil Feizi and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2309.02705},
year = {2025}
}
备注
Accepted at COLM 2024: https://openreview.net/forum?id=9Ik05cycLq