中文

谁传递安全性?识别并靶向跨语言共享安全神经元

计算机视觉与模式识别 2026-02-03 v1

摘要

多语言安全性显著不平衡,使非高资源(NHR)语言在面对稳健的高资源(HR)语言时处于较弱的安全防御。此外,尽管观察到跨语言表征迁移,但推动安全对齐的神经机制仍不明确。本文发现,大语言模型(LLM)中包含一组跨语言共享安全神经元(SS-Neurons),这组神经元虽然数量不多,却在跨语言调控安全行为中起关键作用。我们首先识别出单语言安全神经元(MS-Neurons),并通过针对性激活和抑制验证其在安全拒绝行为中的因果作用。随后,我们的跨语言分析识别出 SS-Neurons 作为 HR 与 NHR 语言间共享的 MS-Neurons 子集,充当 HR 安全能力向 NHR 领域传递的桥梁。我们观察到,抑制这些神经元会导致 NHR 各语言的安全性能同步下降,而强化这些神经元则提升跨语言的防御一致性。基于这些洞察,我们提出一种简单的神经元导向训练策略,依据语言资源分布和模型架构靶向 SS-Neurons。实验表明,针对这些微小神经元子集的微调优于当前最先进的方法,显著提升了 NHR 语言的安全性,同时保持模型的通用能力。代码和数据集将发布于 https://github.com/1518630367/SS-Neuron-Expansion。

关键词

引用

@article{arxiv.2602.01283,
  title  = {Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons},
  author = {Xianhui Zhang and Chengyu Xie and Linxia Zhu and Yonghui Yang and Weixiang Zhao and Zifeng Cheng and Cong Wang and Fei Shen and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2602.01283},
  year   = {2026}
}