翻译中的增益:特权成对评判器增强多语言推理
计算与语言
2026-01-27 v1 机器学习
摘要
当使用训练数据中较少出现的语言提问时,当前的推理大语言模型(RLM)的性能通常远低于用英语提问同一问题的表现。为此,我们引入了 \texttt{SP3F}(带有特权成对反馈的自博弈,Self-Play with Privileged Pairwise Feedback),这是一个无需目标语言中任何数据即可增强多语言推理的两阶段框架。首先,我们在英文问答对的翻译版本上进行监督微调(SFT),以提高基础模型的正确性。其次,我们以自博弈方式利用成对评判器的反馈进行强化学习(RL),其中评判器将英文参考回复作为特权信息。因此,即使模型的所有回复都不完全正确,特权成对评判器仍能判断哪个回复更好。端到端地,\texttt{SP3F} 极大地提升了基础模型的性能,甚至在单语言、多语言以及泛化至未见语言等多种设置下,以少于全量训练数据的表现,在多个数学和非数学任务上超越了完全后训练的模型。
引用
@article{arxiv.2601.18722,
title = {Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning},
author = {Lintang Sutawika and Gokul Swamy and Zhiwei Steven Wu and Graham Neubig},
journal= {arXiv preprint arXiv:2601.18722},
year = {2026}
}
备注
Code available at https://github.com/lintangsutawika/SP3F