中文

面向上下文无关安全对齐的大语言模型

计算与语言 2026-05-21 v1 人工智能

摘要

基于偏好的后训练方法可以将大语言模型与人类意图对齐,但安全行为往往仍然脆弱。模型在标准提示下会拒绝有害请求,但当同一意图被包装在对抗性表述中时却会遵从。我们认为,稳健的安全对齐需要实现上下文无关的对齐,即行为应依赖于底层意图而非表面形式。由于并非所有训练信号都 equally 可信任,在某些提示变体中我们可以获得可验证反馈(例如多选题),而在开放式变体中则通常依赖噪声且易被游戏化的奖励代理(例如学习型评判)。因此,标准的对称性不变正则化会通过降低可靠变体的性能来减少跨上下文差异,而非改善开放式的鲁棒性。为此,我们引入锚定不变正则化(Anchor Invariance Regularization, AIR),将可验证提示视为锚点,并通过停止梯度目标仅对开放式变体进行正则化,以匹配锚点性能。AIR 以可插拔的辅助损失形式实现,并通过异构提示分组与基于群体的偏好优化(例如 GRPO)结合。在安全、道德推理和数学任务上,AIR 提升了上下文无关性,在分布内组准确率提高了 12.71%,分布外一致性提高了 33.49%,使安全约束对抗性表述更具鲁棒性。

关键词

引用

@article{arxiv.2605.20994,
  title  = {Towards Context-Invariant Safety Alignment for Large Language Models},
  author = {Yixu Wang and Yang Yao and Xin Wang and Yifeng Gao and Yan Teng and Xingjun Ma and Yingchun Wang},
  journal= {arXiv preprint arXiv:2605.20994},
  year   = {2026}
}

备注

ICML 2026