MATH-PT:面向欧洲葡萄牙语与巴西葡萄牙语的数学推理基准
计算与语言
2026-04-30 v1 信息检索
摘要
将大型语言模型(LLM)用于复杂数学推理是一个新兴研究领域,在方法、模型和基准数据集方面均取得了快速进展。然而,大多数数学推理评估表现出显著的语言偏差,绝大多数基准数据集仅包含英语,或(充其量)由英语翻译而来。我们通过引入 {\sc Math-PT} 来解决这一局限性,这是一个新颖的数据集,包含 1,729 道用欧洲葡萄牙语和巴西葡萄牙语编写的数学问题。{\sc Math-PT} 从多种高质量原生来源中精选而成,包括葡萄牙和巴西的数学奥林匹克竞赛、比赛和考试。我们在 {\sc Math-PT} 上对当前最先进的 LLM 进行了全面基准测试,结果显示,与开放权重模型相比,前沿推理模型在多项选择题中取得了强劲表现,但在包含图表的问题或开放式问题上的性能则有所下降。为促进未来研究,我们发布了该基准数据集与模型输出。
引用
@article{arxiv.2604.25926,
title = {MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese},
author = {Tiago Teixeira and Ana Carolina Erthal and Juan Belieni and Beatriz Canaverde and Diego Mesquita and Miguel Faria and Eliezer de Souza da Silva and André F. T. Martins},
journal= {arXiv preprint arXiv:2604.25926},
year = {2026}
}
备注
Accepted at 17th International Conference on Computational Processing of Portuguese (PROPOR 2026). Open access to dataset repo https://huggingface.co/datasets/tiagoteixeira03/MATH-PT and model outputs https://github.com/deep-spin/math-benchmark