MMATH:面向数学推理的多语言基准
计算与语言
2025-05-27 v1
摘要
大型推理模型(如OpenAI o1和DeepSeek R1)的出现显著推进了复杂推理任务。然而,它们在多语言复杂推理方面的能力仍未被充分探索,现有工作主要集中于MGSM等较简单的任务。为填补这一空白,我们引入了MMATH,一个涵盖10种类型学上多样化语言的374个高质量数学问题的多语言复杂推理基准。使用MMATH,我们观察到即使是DeepSeek R1等先进模型在不同语言之间也表现出显著的性能差异,并面临严重的偏离目标语言问题——即以非预期语言生成回复。为解决这一问题,我们探索了包括提示和训练在内的策略,证明了用英语推理并用目标语言回答可以同时提升性能并保持目标语言一致性。我们的发现为推进大型语言模型的多语言推理能力提供了新见解和实用策略。我们的代码和数据可在 https://github.com/RUCAIBox/MMATH 找到。
引用
@article{arxiv.2505.19126,
title = {MMATH: A Multilingual Benchmark for Mathematical Reasoning},
author = {Wenyang Luo and Wayne Xin Zhao and Jing Sha and Shijin Wang and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2505.19126},
year = {2025}
}