语言不平衡驱动的奖励机制:用于多语言自我改进的自适应方法
计算与语言
2025-02-27 v3 人工智能
摘要
大型语言模型(LLM)在诸多任务上取得了领先性能,但这些进展主要惠及英语、中文等“一级”语言,许多其他语言仍被严重低估。这种不平衡虽然限制了更广泛的应用,却在语言之间自然生成了偏好排序,为以自我改进的方式引导LLM的多语言能力提供了机遇。因此,我们提出了一种名为"语言不平衡驱动的奖励机制"的方法,其中LLM中占主导地位语言与非占主导地位语言之间的内在不平衡被用作奖励信号。迭代DPO训练表明,这一方法不仅提升了非占主导地位语言的LLM性能,还增强了占主导地位语言的能力,从而产生持续的奖励信号。对Meta-Llama-3-8B-Instruct进行两次迭代训练后,指令跟随和算术推理任务的多语言性能持续提升,平均在X-AlpacaEval排行榜上获胜率提升7.46%,MGSM基准测试准确率提升13.9%。本工作是初始的探索,为LLM的多语言自我改进铺平了道路。代码已公开于https://github.com/ZNLP/Language-Imbalance-Driven-Rewarding
引用
@article{arxiv.2410.08964,
title = {Language Imbalance Driven Rewarding for Multilingual Self-improving},
author = {Wen Yang and Junhong Wu and Chen Wang and Chengqing Zong and Jiajun Zhang},
journal= {arXiv preprint arXiv:2410.08964},
year = {2025}
}
备注
Camera ready version for ICLR 2025