MPO:基于奖励差优化的多语言安全对齐
计算与语言
2025-05-23 v1
摘要
大型语言模型(LLMs)在全球AI应用中日益重要, necessitates robust multilingual safety alignment to ensure secure deployment across diverse linguistic contexts。现有的偏好学习方法(如RLHF和DPO)主要是单语种的,并且在处理噪声多语言数据时表现不佳。为此,我们引入了多语言奖励差优化(Multilingual reward gaP Optimization, MPO),一种新方法,该方法利用主导语言(English)已被良好对齐的安全能力,以提高跨多语言的安全对齐。MPO直接最小化主导语言与目标语言之间的奖励差距,从而在保持主导语言原始优势的同时,将安全能力传递给其他语言。对三个大型语言模型(LLaMA-3.1、Gemma-2和Qwen2.5)进行大规模实验,验证了MPO在不降低通用多语言实用性的前提下实现多语言安全对齐的有效性。
引用
@article{arxiv.2505.16869,
title = {MPO: Multilingual Safety Alignment via Reward Gap Optimization},
author = {Weixiang Zhao and Yulin Hu and Yang Deng and Tongtong Wu and Wenxuan Zhang and Jiahe Guo and An Zhang and Yanyan Zhao and Bing Qin and Tat-Seng Chua and Ting Liu},
journal= {arXiv preprint arXiv:2505.16869},
year = {2025}
}
备注
To Appear at ACL 2025 (Main)