中文

Self-Guard:赋予大语言模型自我保护能力

计算与语言 2024-03-25 v2

摘要

越狱攻击可绕过大型语言模型(LLM)的安全措施,生成有害内容。这种对LLM的滥用已导致负面的社会后果。目前,应对越狱攻击主要有两种方法:安全训练与防护机制。安全训练侧重于进一步训练LLM以增强其安全性。另一方面,防护机制涉及部署外部模型或过滤器以防止有害输出。然而,安全训练在适应新型攻击类型方面存在局限,且常导致模型性能下降。防护机制已被证明帮助有限。为解决这些问题,我们提出一种称为Self-Guard的新方法,它结合了两类安全方法的优势。Self-Guard包含两个阶段。第一阶段,我们增强模型评估有害内容的能力;第二阶段,我们指示模型持续对其自身回复进行有害内容检测。实验表明Self-Guard对越狱攻击具有鲁棒性。在坏案例分析中,我们发现LLM偶尔会对有害查询给出无害回复。此外,我们在安全训练前后评估了LLM的通用能力,证明Self-Guard不会导致LLM性能退化。在敏感性测试中,Self-Guard不仅避免诱发LLM的过度敏感,甚至能缓解该问题。

关键词

引用

@article{arxiv.2310.15851,
  title  = {Self-Guard: Empower the LLM to Safeguard Itself},
  author = {Zezhong Wang and Fangkai Yang and Lu Wang and Pu Zhao and Hongru Wang and Liang Chen and Qingwei Lin and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2310.15851},
  year   = {2024}
}