我们还有多远?LLM与人类专家在数学建模竞赛中的系统性评估
计算与语言
2026-04-07 v1
摘要
大型语言模型(LLM)在推理基准测试中取得了强劲表现,但它们解决需要端到端工作流的真实世界问题的能力仍不明确。数学建模竞赛为评估此类端到端问题求解能力提供了严格的测试平台。本文提出了一种面向问题、分阶段评估的框架,利用专家验证的标准对LLM在各建模阶段的表现进行评估。通过将自动评分与中国研究生数学建模竞赛问题的独立人类专家判断进行对比,我们验证了该框架的可靠性,其一致性显著优于现有评估方案。利用该框架,我们揭示了最先进LLM中存在的理解-执行差距:尽管它们在问题识别与构建等早期阶段表现良好,但在模型求解、代码实现和结果分析等面向执行的阶段中持续存在缺陷。即使增加模型规模,这些差距依然存在。我们进一步将这些失败归因于规范不足、缺失验证和缺乏校验,且错误在各阶段之间传播而未被纠正。我们的发现表明,弥合这一差距需要超越模型缩放的方法,为将LLM应用于复杂现实问题求解提供了洞见。
引用
@article{arxiv.2604.04791,
title = {How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling},
author = {Yuhang Liu and Heyan Huang and Yizhe Yang and Hongyan Zhao and Zhizhuo Zeng and Yang Gao},
journal= {arXiv preprint arXiv:2604.04791},
year = {2026}
}