中文

数学推理中测试时缩放的语言泛化性

计算与语言 2025-08-04 v2

摘要

扩展预训练计算量已被证明是实现多语言性的有效方法,但测试时缩放是否同样如此?在本工作中,我们引入了 MCLM,这是一个包含 55 种语言竞赛级问题的多语言数学基准。我们在 Qwen2.5-1.5B Math 和我们为扩展推理而训练的多语言 LLM MR1-1.5B 上,测试了三种测试时缩放方法:结果奖励建模(ORM)、过程奖励建模(PRM)和预算强制(BF)。我们的实验表明,使用 Qwen2.5-1.5B Math 结合 ORM 在 MCLM 上取得了 35.8 分,而 BF 在 MR1-1.5B 上取得了 35.2 分。尽管“思考型 LLM”最近引起了极大关注,我们发现一旦限制在相似的推理 FLOPs 水平上,其性能与传统缩放方法(如 best-of-N)相当。此外,尽管 BF 在英语 AIME 上带来了 20 分的提升,但在其他语言上仅提供了 1.94 分的平均增益——这一模式在我们研究的其他测试时缩放方法中同样存在——这表明测试时缩放可能无法同样有效地泛化到多语言任务。为促进进一步研究,我们发布了 MCLM、MR1-1.5B 及评估结果。

关键词

引用

@article{arxiv.2502.17407,
  title  = {Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning},
  author = {Guijin Son and Jiwoo Hong and Hyunwoo Ko and James Thorne},
  journal= {arXiv preprint arXiv:2502.17407},
  year   = {2025}
}

备注

ACL 2025 (ORAL)