中文

MATH-PT:面向欧洲葡萄牙语与巴西葡萄牙语的数学推理基准

计算与语言 2026-04-30 v1 信息检索

摘要

将大型语言模型(LLM)用于复杂数学推理是一个新兴研究领域,在方法、模型和基准数据集方面均取得了快速进展。然而,大多数数学推理评估表现出显著的语言偏差,绝大多数基准数据集仅包含英语,或(充其量)由英语翻译而来。我们通过引入 {\sc Math-PT} 来解决这一局限性,这是一个新颖的数据集,包含 1,729 道用欧洲葡萄牙语和巴西葡萄牙语编写的数学问题。{\sc Math-PT} 从多种高质量原生来源中精选而成,包括葡萄牙和巴西的数学奥林匹克竞赛、比赛和考试。我们在 {\sc Math-PT} 上对当前最先进的 LLM 进行了全面基准测试,结果显示,与开放权重模型相比,前沿推理模型在多项选择题中取得了强劲表现,但在包含图表的问题或开放式问题上的性能则有所下降。为促进未来研究,我们发布了该基准数据集与模型输出。

关键词

引用

@article{arxiv.2604.25926,
  title  = {MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese},
  author = {Tiago Teixeira and Ana Carolina Erthal and Juan Belieni and Beatriz Canaverde and Diego Mesquita and Miguel Faria and Eliezer de Souza da Silva and André F. T. Martins},
  journal= {arXiv preprint arXiv:2604.25926},
  year   = {2026}
}

备注

Accepted at 17th International Conference on Computational Processing of Portuguese (PROPOR 2026). Open access to dataset repo https://huggingface.co/datasets/tiagoteixeira03/MATH-PT and model outputs https://github.com/deep-spin/math-benchmark