MathRobust-LV:评估大语言模型在数学推理中对语言变化的鲁棒性
计算与语言
2025-10-09 v1
摘要
大型语言模型在数学基准测试中表现优异,但其对语言变化的数学推理鲁棒性尚未得到充分探索。虽然近期研究越来越将高难度竞赛(如IMO)视为评估推理能力的金标准,但我们认为应全面评估教育场景中高中水平的数学问题。我们引入MathRobust-LV,一个测试集和评估方法,模拟教师在不同测验中以保持难度不变对问题进行重新表述的过程:通过改变表面细节(如人名、情境、变量)来保留数值结构和答案。与以往工作不同,后者会改变问题内容或强调IMO水平任务,而本文聚焦于当前教育应用场景中模型部署的水平——中学水平数据集问题,对教学和评估系统尤为重要。在这些应用中,教师会以不同方式表述相同的概念,使得语言鲁棒性对于可靠部署至关重要。尽管MATH数据集评估常被视为饱和,但我们对34个模型进行实验,发现其在基线问题与变体问题之间的准确率下降。这种下降对较小的模型(下降9-11%)尤为严重,而更强大的模型也表现出可测量的性能下降。前沿模型如GPT-5、Gemini-2.5pro保持较为稳定。我们的结果表明,语言变化的鲁棒性是一项基本挑战,揭示了模型推理中的脆弱性。
引用
@article{arxiv.2510.06430,
title = {MathRobust-LV: Evaluation of Large Language Models' Robustness to Linguistic Variations in Mathematical Reasoning},
author = {Neeraja Kirtane and Yuvraj Khanna and Peter Relan},
journal= {arXiv preprint arXiv:2510.06430},
year = {2025}
}