中文

基于上下文学习防御预填充攻击没有免费午餐

密码学与安全 2024-12-18 v1 人工智能

摘要

自 ChatGPT 出现以来,大型语言模型(LLM)的安全性已成为重要研究课题。尽管已有各种有效方法来防御越狱攻击,但预填充攻击仍然是针对开源 LLM 的一种未解决且普遍的威胁。上下文学习(ICL)提供了一种计算高效的防御手段来应对各种越狱攻击,但目前尚未开发出有效的 ICL 方法来对抗预填充攻击。在本文中,我们:(1)展示了 ICL 可以通过在示例中采用转折句结构,有效防御预填充越狱攻击;(2)从模型规模、示例数量、过度防御、与其他越狱攻击的结合以及安全对齐的存在等角度,刻画了该防御方法的有效性。结合实验结果和我们的分析,我们得出结论:使用 ICL 防御预填充越狱攻击没有免费午餐。一方面,当前的安全对齐方法无法缓解预填充越狱攻击,但 ICL 示例中的转折结构在各种模型规模和复杂的越狱攻击中均提供了鲁棒的防御。另一方面,当利用带有转折结构的 ICL 示例时,LLM 表现出相似的过度防御性,且这种行为似乎与模型规模无关。

关键词

引用

@article{arxiv.2412.12192,
  title  = {No Free Lunch for Defending Against Prefilling Attack by In-Context Learning},
  author = {Zhiyu Xue and Guangliang Liu and Bocheng Chen and Kristen Marie Johnson and Ramtin Pedarsani},
  journal= {arXiv preprint arXiv:2412.12192},
  year   = {2024}
}