中文

强化学习如何提升大语言模型在跨语言推理中的表现

计算与语言 2025-09-30 v1

摘要

提升大型语言模型(LLM)的复杂推理能力备受广泛关注。尽管强化学习(RL)在提高复杂推理方面显示出优越性能,但其对跨语言泛化的影响与监督微调(SFT)尚未得到探讨。我们首次系统性地调查了RL和SFT在跨语言推理泛化方面的表现。以Qwen2.5-3B-Base为基础模型,我们在包括数学推理、常识推理和科学推理等多样化的多语言推理基准上进行实验。我们的调查得出两个重要发现:(1)使用RL调谋不仅实现更高的准确率,而且在跨语言推理方面表现出显著更强的泛化能力;(2)在非英语数据上进行RL训练比在英语数据上训练更能提升整体性能和泛化,这一现象在SFT中并未观察到。此外,通过全面的机制分析,我们探讨了RL在跨语言方面的优越性和泛化背后的因素。我们的结果为RL使模型拥有更稳健的推理策略提供了有力证据,为更公平和有效的多语言推理提供了关键指导。

关键词

引用

@article{arxiv.2509.23657,
  title  = {Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs},
  author = {Shulin Huang and Yiran Ding and Junshu Pan and Yue Zhang},
  journal= {arXiv preprint arXiv:2509.23657},
  year   = {2025}
}