检讨数学推理推理规模下的误报现象
计算与语言
2025-09-19 v2 人工智能
摘要
近期语言模型的进展导致在各种基准上实现了显著的数学推理改进。然而,这些大多数基准依赖仅比较最终答案的自动评估方法,缺乏对底层推理步骤的验证,导致出现误报解——即模型可能产生正确的最终答案,但推理路径存在缺陷。本文系统性地检讨了语言模型在数学问题解决中误报解的流行程度。我们分析了不同开源模型、不同难度水平的数据集以及不同解码策略下误报解的特征和范围。具体地,我们探讨了误报解如何影响语言模型的推理时间规模行为。我们的实验结果揭示了:(1) 误报解在不同模型、数据集和解码方法中都持续存在;(2) 基于抽样的推理时间规模方法并不能缓解此问题;(3) pass@N 评估指标更容易受到误报解的影响,表明其规模天花板显著低于自动评估所显示的水平。此外,我们分析了具体的误报实例并讨论了在此类条件下自我改进技术和合成数据生成的潜在局限性。我们的数据和代码已公开于 https://github.com/Wloner0809/False-Positives-in-Math。
引用
@article{arxiv.2502.06217,
title = {Examining False Positives under Inference Scaling for Mathematical Reasoning},
author = {Yu Wang and Nan Yang and Liang Wang and Furu Wei and Fuli Feng},
journal= {arXiv preprint arXiv:2502.06217},
year = {2025}
}