中文

面向 LLM 安全的语义瓶颈处的语言无关语义对齐 (LASA)

机器学习 2026-04-24 v2 人工智能 计算与语言

摘要

大型语言模型 (LLM) 在高资源语言中通常表现出良好的安全性能,但在低资源语言中则暴露出严重的漏洞。我们将这一差距归因于语言无关语义理解能力与以语言为主导的安全对齐之间的偏差——后者偏向高资源语言。我们进一步通过实证研究识别了 LLM 中的语义瓶颈,即模型表示几何主要由共享语义内容而非语言身份主导的中间层。在此基础上,我们提出语言无关语义对齐 (LASA),在语义瓶颈处锚定安全对齐。在实验中,我们发现 LASA 在所有语言上均显著提升了安全性能:在 LLaMA-3.1-8B-Instruct 上,攻击成功率 (ASR) 从 24.7% 下降至 2.8%,在 Qwen2.5 和 Qwen3 Instruct 模型 (7B-32B) 上保持在 3-4% 左右。我们的分析和方法提供了一种关于 LLM 安全的表示层视角,表明安全对齐需要将安全理解锚定在模型的语言无关语义空间中,而非表面文本。

关键词

引用

@article{arxiv.2604.12710,
  title  = {LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety},
  author = {Junxiao Yang and Haoran Liu and Jinzhe Tu and Jiale Cheng and Zhexin Zhang and Shiyao Cui and Jiaqi Weng and Jialing Tao and Hui Xue and Hongning Wang and Han Qiu and Minlie Huang},
  journal= {arXiv preprint arXiv:2604.12710},
  year   = {2026}
}