中文

XGUARD:评估大型语言模型在极端主义内容上安全失效的分级基准

计算与语言 2025-06-03 v1

摘要

大型语言模型(LLM)可以生成从意识形态言论到明确暴力指令的各类内容。然而,现有的安全评估通常依赖于简单的二元标签(安全和不安全),忽视了这些输出所构成的细微风险谱系。为了解决这一问题,我们提出了 XGUARD,一个旨在评估 LLM 生成的极端主义内容严重程度的基准和评估框架。XGUARD 包含 3,840 个源自社交媒体和新闻等真实世界数据的红队测试提示,涵盖了广泛的意识形态化场景。我们的框架将模型响应分为五个危险级别(0 到 4),从而能够对失效的频率和严重程度进行更细致的分析。我们引入了可解释的攻击严重程度曲线(ASC),以可视化漏洞并比较不同威胁强度下的防御机制。使用 XGUARD,我们评估了六个流行的 LLM 和两种轻量级防御策略,揭示了当前安全差距以及鲁棒性与表达自由之间权衡的关键见解。我们的工作强调了分级安全指标对于构建可信赖 LLM 的价值。

关键词

引用

@article{arxiv.2506.00973,
  title  = {XGUARD: A Graded Benchmark for Evaluating Safety Failures of Large Language Models on Extremist Content},
  author = {Vadivel Abishethvarman and Bhavik Chandna and Pratik Jalan and Usman Naseem},
  journal= {arXiv preprint arXiv:2506.00973},
  year   = {2025}
}

备注

Preprint