Soteria:面向多语言安全对齐的语言特定功能参数引导
计算与语言
2025-08-25 v2 人工智能
摘要
确保多种语言之间的一致安全性对大语言模型(LLMs)仍然是一个重大挑战。我们引入了Soteria,一种轻量但强大的策略,用于定位并最小化调整每种语言中最负责生成有害内容的“功能头”。仅通过改变一小部分参数,Soteria大幅减少了策略违规,同时没有牺牲整体模型性能,即使在低资源环境中也是如此。为了严格评估我们的方法,我们还提出了XThreatBench,一个专门的多语言数据集,用于从真实政策指南中捕获细粒度的有害行为。在主流开源LLMs(如Llama、Qwen、Mistral)上的实验表明,Soteria始终提高了高、中、低资源语言的安全指标。这些发现突显了通向可扩展、语言适配和伦理对齐的全球LLMs的有希望路径。
引用
@article{arxiv.2502.11244,
title = {Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment},
author = {Somnath Banerjee and Sayan Layek and Pratyush Chatterjee and Animesh Mukherjee and Rima Hazra},
journal= {arXiv preprint arXiv:2502.11244},
year = {2025}
}
备注
Accepted at EMNLP 2025