AI4Math:面向大语言模型的原生西班牙语大学水平数学推理基准
计算与语言
2025-05-27 v1
摘要
现有数学推理基准主要为英文版本或翻译版,可能引入语义漂移并掩盖语言特定的推理错误。为此,我们提出AI4Math,一个包含105个原生西班牙语大学水平数学问题的数据集。数据集涵盖七个高级领域(代数、微积分、几何、概率、数论、组合、逻辑),每个问题都配有逐步的人类解答。我们评估了六个大语言模型 GPT 4o、GPT 4o mini、o3 mini、LLaMA 3.3 70B、DeepSeek R1 685B 和 DeepSeek V3 685B 在四种配置下的表现:零shot和链式思考,分别以西班牙语和英文进行。排名前三的模型(o3 mini、DeepSeek R1 685B、DeepSeek V3 685B)准确率超过70%,而 LLaMA 3.3 70B 和 GPT-4o mini 仍低于40%。大多数模型在两种语言之间表现无显著差异,GPT 4o 在零shot 设置下甚至在西班牙语问题上表现更好。几何、组合和概率问题对所有模型都仍然具有持久的挑战性。这些结果凸显了原生语言基准和领域特定评估的必要性,以揭示标准指标未能捕捉的推理失效。
引用
@article{arxiv.2505.18978,
title = {AI4Math: A Native Spanish Benchmark for University-Level Mathematical Reasoning in Large Language Models},
author = {Miguel Angel Peñaloza Perez and Bruno Lopez Orozco and Jesus Tadeo Cruz Soto and Michelle Bruno Hernandez and Miguel Angel Alvarado Gonzalez and Sandra Malagon},
journal= {arXiv preprint arXiv:2505.18978},
year = {2025}
}
备注
36 pages, 5 figures