BanglaMATH:面向 6、7、8 年级的数学推理的孟加拉语基准数据集
计算机与社会
2025-10-16 v1
摘要
大语言模型(LLM)在数学推理方面具有巨大潜力,广泛应用于教育和人工智能研究。然而,大多数现有基准仅限于英文,为低资源语言构成显著鸿沟。例如,孟加拉语拥有约 2.5 亿使用者,若干人将从 LLM 具备本土流利度的成果中受益。为此,我们提出 BanglaMATH,包含 1.7 万道孟加拉语数学应用题,涵盖算术、代数、几何和逻辑推理等主题,数据来源于孟加拉语小学教材,并标注了年级水平和推理步骤数。我们设计 BanglaMATH 以评估商业与开源 LLM 在孟加拉语中的数学能力,发现 Gemini 2.5 Flash 和 DeepSeek V3 是唯一在三个小学年级中实现优异性能的模型,准确率均达到 80% 以上。此外,我们通过增加干扰信息或将问题翻译为英文评估了这些顶尖模型的鲁棒性和语言偏置。我们表明,这些 LLM 在孟加拉语中鲁棒性不足,存在显著语言偏置。本研究凸显了当前 LLM 在低资源语言中处理算术与数学推理的局限性,并呼吁进一步关注多语言和公平的数学理解。数据集链接:\href{https://github.com/TabiaTanzin/BanglaMATH-A-Bangla-benchmark-dataset-for-testing-LLM-mathematical-reasoning-at-grades-6-7-and-8.git}{https://github.com/BanglaMATH}
引用
@article{arxiv.2510.12836,
title = {BanglaMATH : A Bangla benchmark dataset for testing LLM mathematical reasoning at grades 6, 7, and 8},
author = {Tabia Tanzin Prama and Christopher M. Danforth and Peter Sheridan Dodds},
journal= {arXiv preprint arXiv:2510.12836},
year = {2025}
}