中文

MGSM-Pro:鲁棒多语言数学推理评估的简单策略

计算与语言 2026-04-29 v2 人工智能

摘要

大型语言模型在数学推理方面取得了显著进展。然而,针对多语言评估的基准开发在难度和时效性上仍滞后于英语。最近的 GSM-Symbolic 显示,在模型对同一问题的不同实例化时表现出显著方差;但该评估仅在英语语境下进行。本文介绍 MGSM-Pro,这是基于 MGSM 数据集并引入 GSM-Symbolic 方法的扩展数据集。该数据集为每个 MGSM 题目提供五个不同实例化,通过变化名称、数字及无关上下文来实现变体。跨九种语言的评估揭示,许多低资源语言在测试不同数字实例化时表现显著下降。我们进一步发现,HRL 环境下模型的鲁棒性并不一定转化为 LRL。专有模型如 Gemini 2.5 Flash 和 GPT-4.1 对数字变化不够鲁棒,而 Gemini 3.0 Pro 较为鲁棒。在开源模型中,GPT-OSS 120B 和 DeepSeek v3 显示出更强的鲁棒性。基于这些发现,我们建议对每个问题使用至少五个数字变体进行评估,以获得更稳健和更真实的数学推理评估。

关键词

引用

@article{arxiv.2601.21225,
  title  = {MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation},
  author = {Tianyi Xu and Kosei Uemura and Alfred Malengo Kondoro and Tadesse Destaw Belay and Catherine Nana Nyaah Essuman and Ifeoma Okoh and Ganiyat Afolabi and Ayodele Awokoya and David Ifeoluwa Adelani},
  journal= {arXiv preprint arXiv:2601.21225},
  year   = {2026}
}