中文

通过提示对抗微调反击越狱攻击

机器学习 2024-11-01 v4 人工智能 计算与语言 密码学与安全

摘要

尽管大型语言模型 (LLMs) 在各种应用中取得了巨大成功,但它们也容易受到越狱攻击。已经提出了几种主要的防御策略来保护 LLMs 免于产生有害信息,主要集中在模型微调或启发式防御设计上。然而,如何通过提示优化实现内在鲁棒性仍然是一个开放问题。在本文中,受对抗训练范式在实现可靠鲁棒性方面的启发,我们提出了一种名为提示对抗微调 (PAT) 的方法,该方法训练一个附加在用户提示上的提示控制作为防御前缀。为了在实现防御目标的同时保持自然性能,我们使用对抗提示和良性提示共同优化控制提示。综合实验表明,我们的方法对灰盒和黑盒攻击均有效,将高级攻击的成功率降至接近 0%,同时保持了模型在良性任务上的效用,且仅产生可忽略不计的计算开销,为未来 LLM 安全性的探索描绘了新视角。我们的代码可在 https://github.com/PKU-ML/PAT 获取。

关键词

引用

@article{arxiv.2402.06255,
  title  = {Fight Back Against Jailbreaking via Prompt Adversarial Tuning},
  author = {Yichuan Mo and Yuji Wang and Zeming Wei and Yisen Wang},
  journal= {arXiv preprint arXiv:2402.06255},
  year   = {2024}
}