中文

安全并非普适:LLM对齐中的选择性安全陷阱

计算与语言 2026-04-30 v2 人工智能

摘要

当前对大型语言模型(LLM)的安全评估通过将伤害聚合到诸如“身份仇恨”等通用类别下,制造了一种危险的普适保护幻觉,掩盖了对特定人群的脆弱性。在本文中,我们暴露了选择性安全陷阱:一种系统性失效模式,其中模型对特定人群拥有稳健的防御,却使边缘群体对相同的对抗攻击极其脆弱。为系统性审计这一现象,我们引入MiJaBench,一个双语(英语-葡萄牙语)对抗基准,包含43,961个受控的恶作剧提示,覆盖16个少数群体。通过对14个最先进的LLM在MiJaBench上的评估,我们策划了615,454个提示-响应对,构成MiJaBench-Align,揭示安全对齐并非统一的语义能力,而是人口统计学等级制度,防御率在同一模型内因目标群体不同而波动最高可达42%。这种差异在不同架构和语言之间持续存在,并因规模扩大而被放大,表明当前的对齐方法学习的是特定群体的安全措施,而非普遍的伤害概念。通过针对1B参数基线进行有针对性的直接偏好优化(DPO),我们实现了对完全未见的地理统计学和复杂攻击策略的强大零样本安全泛化。我们发布所有数据集和脚本,为社区提供实现公平、可迁移安全对齐的具体路径。

关键词

引用

@article{arxiv.2601.04389,
  title  = {Safety Is Not Universal: The Selective Safety Trap in LLM Alignment},
  author = {Iago Alves Brito and Walcy Santos Rezende Rios and Julia Soares Dollis and Diogo Fernandes Costa Silva and Arlindo Rodrigues Galvão Filho},
  journal= {arXiv preprint arXiv:2601.04389},
  year   = {2026}
}

备注

9 pages, 5 figures and 4 tables in paper (more in appendix)