中文

跨语言奖励建模的数学推理最佳实践

计算与语言 2025-09-22 v1 人工智能

摘要

尽管大型语言模型 (LLM) 的推理能力不断提升,但仍不清楚这种能力在多语言 LLM 中是否在不同语言之间存在差异,以及不同语言是否产生互补的推理路径。为探讨此问题,我们训练了一个奖励模型来对给定问题在不同语言中生成的回答进行排序。我们的结果表明,与仅在单一语言内进行奖励建模相比,我们的跨语言奖励模型在数学推理性能上显著提升,甚至惠及高资源语言。虽然英语常常在多语言模型中表现最佳,但我们发现,在低采样预算下,跨语言采样尤其受益于英语。我们的发现揭示了利用多样化语言互补优势以改进多语言推理的新机会。

关键词

引用

@article{arxiv.2509.15811,
  title  = {Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning},
  author = {Sara Rajaee and Rochelle Choenni and Ekaterina Shutova and Christof Monz},
  journal= {arXiv preprint arXiv:2509.15811},
  year   = {2025}
}