中文

评估大型语言模型安全护栏模型针对对抗攻击的鲁棒性

密码学与安全 2025-12-01 v1

摘要

大型语言模型(LLM)安全护栏模型已成为防止有害内容生成的首要防御机制,但其针对高级对抗攻击的鲁棒性仍不为人所了解。本研究在 21 类攻击范畴内,针对 1445 个测试提示,评估了来自 Meta、Google、IBM、NVIDIA、Alibaba 和 Allen AI 的十个公开可用的护栏模型。虽然 Qwen3Guard-8B 在整体准确率上取得最高值(85.3%,95% 置信区间:83.4%-87.1%),但在将公开基准提示与新颖攻击分开后发现了一个关键发现:所有模型在未出现的提示上的表现都显著下降,其中 Qwen3Guard 的准确率从 91.0% 降至 33.8%(下降 57.2 个百分点)。相比之下,Granite-Guardian-3.2-5B 在泛化能力上表现最佳,仅出现 6.5% 的下降幅度。还发现一种“有帮助模式”的越狱方式,其中两款护栏模型(Nemotron-Safety-8B、Granite-Guardian-3.2-5B)会生成有害内容而非屏蔽它,这代表一种新型的失效模式。这些发现表明,基准性能可能因训练数据污染而误导,护栏模型的泛化能力而非整体准确率,应成为护栏评估的主要指标。

关键词

引用

@article{arxiv.2511.22047,
  title  = {Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks},
  author = {Richard J. Young},
  journal= {arXiv preprint arXiv:2511.22047},
  year   = {2025}
}

备注

21 pages, 9 figures, 6 tables