中文

超越准确率:评估LLM数学推理中的策略多样性

人工智能 2026-05-12 v1 计算机与社会

摘要

大型语言模型已在数学推理基准测试中实现高的最终答案准确率,但准确率alone无法捕捉推理的灵活性。我们引入了一个在80个AMC 10/12和AIME问题上实现的策略级别评估框架,采用217套AoPS衍生参考策略族。模型输出被标注用于策略身份、有效性和正确性,采用双AI编码并进行人工裁决。在四个前沿模型中,我们发现答案准确率与策略多样性之间存在显著的脱节。在单一解决方案提示下,所有模型均实现高准确率(95%-100%),但在多策略提示下,它们恢复的策略数量远少于人类参考答案。Gemini、DeepSeek、GPT和Claude分别生成了184、152、151和110个不同的有效策略,几何和数论领域的差距最大。该模型集合产生了50个基准新颖的有效策略,表明既有对人类策略覆盖不完整,也有一定的替代推理能力。对20个问题进行的重复运行鲁棒性检查显示,在发现的策略数量上存在递减趋势,最强模型在第三次运行后仅恢复了55个AoPS参考策略中的39个(71%)。这些发现将策略多样性置于评估数学推理的补充维度,超越答案正确性。

关键词

引用

@article{arxiv.2605.09292,
  title  = {Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning},
  author = {Xia Yang and Xuanyi Zhang and Hao Hu and Feng Ji},
  journal= {arXiv preprint arXiv:2605.09292},
  year   = {2026}
}