面向通用多语言安全性的层级置换方法
计算与语言
2026-02-16 v2
摘要
尽管大型语言模型(LLMs)取得了快速进展,但安全风险仍是低资源语言的关键挑战。现有安全数据集主要以英语为中心,限制了多语言安全对齐的进展。结果是,针对各自指令数据集进行微调的低资源专家模型往往表现出高于高资源对应模型的更高不安全率。本文提出一种感知安全的层级置换方法,通过无需额外训练地将英语安全专家的安全对齐 transferred 到低资源语言专家。为进一步增强迁移能力,我们的方法根据其专业化程度自适应选择或混合模块。我们的方法在保持一般语言理解任务性能的同时,提升了目标语言的安全性。实验结果表明,所提方法在MMMLU、BELEBELE和MGSM等通用基准上,性能相当于语言专家,同时在MultiJail安全基准上生成更具对齐性且更少有害的响应。
引用
@article{arxiv.2601.22620,
title = {Layer-wise Swapping for Generalizable Multilingual Safety},
author = {Hyunseo Shin and Wonseok Hwang},
journal= {arXiv preprint arXiv:2601.22620},
year = {2026}
}
备注
EACL 2026 main