CONGRAD:面向多语言偏好对齐的冲突梯度过滤
计算与语言
2025-11-12 v2
摘要
大语言模型(LLM)在多语言偏好对齐中进行联合训练会遭受负面干扰。这一现象在多语言训练中已为人所知,冲突目标会降低整体性能。然而,在多语言偏好对齐的语境下,这一现象的影响仍大体未被探索。为此,我们提出了 CONGRAD,这是一种可扩展且有效的过滤方法,从而选择跨语言梯度冲突最小的高质量偏好样本。我们的方法利用梯度手术技术保留与聚合的多语言更新方向对齐的样本。此外,我们还纳入亚线性梯度压缩策略,以减少梯度累积期间的内存开销。我们将 CONGRAD 集成到自奖励框架中,并在 LLaMA3-8B 和 Gemma2-2B 上进行跨 10 种语言的评估。结果表明,CONGRAD 在见到的语言和未见到的语言中均优于强大的基线,几乎没有产生 alignment tax。
引用
@article{arxiv.2503.23777,
title = {CONGRAD:Conflicting Gradient Filtering for Multilingual Preference Alignment},
author = {Jiangnan Li and Thuy-Trang Vu and Christian Herold and Amirhossein Tebbifakhr and Shahram Khadivi and Gholamreza Haffari},
journal= {arXiv preprint arXiv:2503.23777},
year = {2025}
}