安全隐藏空间:多语言情境下的偏好调优大语言模型
计算与语言
2025-04-04 v1
摘要
对齐调优使大型语言模型在推理、遵循指令以及最小化有害生成方面表现卓越。然而,尽管这些模型已广泛部署,它们仍表现出单语言偏见,这引发了对对齐在多语言环境下有效性的担忧。当前的对齐方法主要聚焦于英文,导致对齐机制在多语言情境下的泛化仍不明了。为此,我们系统性地分析了大语言模型在对齐前后嵌入空间中的分布性偏移,并阐明了其对不同语言模型行为的影响。我们利用对齐导致的安全空间分离作为量化工具,以衡量对齐如何强制执行安全约束。我们的研究使用平衡的有毒数据集和平行文本去有害化基准测试,对七个大语言模型进行评估,发现高资源语言与低资源语言在潜在表示空间之间存在显著差异。这些发现凸显了针对不同语言进行特定微调的必要性,以确保多语言对齐的公平性、可靠性和鲁棒性。我们的见解为开发真正安全的多语言大语言模型奠定了基础,强调了在资源不足的语言中消除对齐差距的紧迫性。
引用
@article{arxiv.2504.02708,
title = {The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context},
author = {Nikhil Verma and Manasa Bharadwaj},
journal= {arXiv preprint arXiv:2504.02708},
year = {2025}
}
备注
14 pages, 11 Figures, 2 Tables, currently under review at ACL 2025