中文

LLM的安全训练能否泛化到语义相关的自然提示?

计算与语言 2025-03-26 v2 人工智能

摘要

大型语言模型(LLM)已知容易受到精心设计的对抗性攻击或越狱攻击,从而在安全微调方法使其与人类偏好对齐后仍生成令人反感的内容。虽然输入令牌空间的高维性使得找到能越狱这些模型的对抗性提示不可避免,但我们旨在评估安全微调后的LLM是否对与对齐后引发安全响应的有毒种子提示语义相关的自然提示是安全的。我们惊讶地发现,像GPT-4这样流行的对齐LLM可以被并非以越狱模型为目的而精心设计的朴素提示所攻破。此外,我们通过实验证明,给定一个能从未对齐模型引发有毒响应的种子提示,可以系统地生成多个语义相关的自然提示来越狱对齐的LLM。为此,我们提出了一种名为响应引导问题增强(ReG-QA)的方法,用于评估安全对齐LLM对自然提示的泛化能力,该方法首先使用未对齐的LLM根据种子问题生成多个有毒答案(Q到A),然后利用LLM生成可能产生这些答案的问题(A到Q)。有趣的是,我们发现像GPT-4o这样的安全微调LLM容易从不安全内容中产生自然的越狱问题(且不拒绝),因此可用于后一步骤(A到Q)。我们获得的攻击成功率与JailbreakBench排行榜上的领先对抗攻击方法相当或更高,同时对于Smooth-LLM和同义词替换等防御手段(这些防御手段对排行榜上所有现有攻击都有效)显著更稳定。

关键词

引用

@article{arxiv.2412.03235,
  title  = {Does Safety Training of LLMs Generalize to Semantically Related Natural Prompts?},
  author = {Sravanti Addepalli and Yerram Varun and Arun Suggala and Karthikeyan Shanmugam and Prateek Jain},
  journal= {arXiv preprint arXiv:2412.03235},
  year   = {2025}
}

备注

Accepted in ICLR 2025