中文

通过语义平滑防御大型语言模型免受越狱攻击

计算与语言 2024-03-01 v2

摘要

对齐的大型语言模型(LLM)容易受到越狱攻击,这些攻击绕过目标LLM的安全防护,诱使其生成不当内容。虽然初步防御措施在基于令牌的威胁模型上显示出前景,但目前尚不存在能够抵御语义攻击并在鲁棒性与标称性能之间避免不利权衡的防御方法。为满足这一需求,我们提出SEMANTICSMOOTH,一种基于平滑的防御方法,该方法聚合给定输入提示的多个语义变换副本的预测结果。实验结果表明,SEMANTICSMOOTH在抵御GCG、PAIR和AutoDAN攻击方面达到了最先进的鲁棒性,同时在指令遵循基准(如InstructionFollowing和AlpacaEval)上保持了强大的标称性能。代码将在https://github.com/UCSB-NLP-Chang/SemanticSmooth公开。

关键词

引用

@article{arxiv.2402.16192,
  title  = {Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing},
  author = {Jiabao Ji and Bairu Hou and Alexander Robey and George J. Pappas and Hamed Hassani and Yang Zhang and Eric Wong and Shiyu Chang},
  journal= {arXiv preprint arXiv:2402.16192},
  year   = {2024}
}

备注

37 pages