偏好调优在毒性减轻中的跨语言泛化
计算与语言
2024-11-11 v2 人工智能
密码学与安全
机器学习
摘要
由于其日益增长的全球使用,针对多语言大型语言模型 (LLM) 的去毒化已成为关键任务。在本研究中,我们探讨了偏好调优在 LLM 去毒化中的零样本跨语言泛化。不同于其他安全任务显示有限跨语言泛化的先前研究,我们展示了仅用英文数据进行 Direct Preference Optimization (DPO) 训练即可显著降低多语言开放生成文本的毒性。例如,训练后 mGPT-1.3B 在 17 种语言中生成毒性文本的概率从 46.8% 降至 3.9%。我们的研究结果也适用于其他多语言 LLM,如 BLOOM、Llama3 和 Aya-23。使用机制性可解释性工具如因果干预和激活分析,我们识别了 LLM 中 MLP 层的双重多语言性质,解释了 DPO 跨语言泛化的机制。最后,我们表明双语句子检索可预测 DPO 偏好调优的跨语言迁移能力。
引用
@article{arxiv.2406.16235,
title = {Preference Tuning For Toxicity Mitigation Generalizes Across Languages},
author = {Xiaochen Li and Zheng-Xin Yong and Stephen H. Bach},
journal= {arXiv preprint arXiv:2406.16235},
year = {2024}
}
备注
Findings of EMNLP 2024