逐步验证数学问题
计算与语言
2026-03-13 v2 人工智能
摘要
大型语言模型(LLM)近期在数学推理方面取得显著进展。为实现此能力,现有许多工作通过蒸馏强推理模型生成长链式思考,或设计算法构建高质量数学问题-答案(QA)数据进行训练。然而,这些努力主要聚焦于生成正确的推理路径和答案,而大体忽视了问题本身的正确性。本文提出了ValiMath,一个包含2147个人工验证的数学问题基准,覆盖算术、代数、几何等多个领域,其从NuminaMath数据集中综合和精选。每个问题都标注了其逻辑结构、领域覆盖情况和问题正确性,以实现对问题质量的细粒度评估。ValiMath作为LLM训练语料中数学问题验证的高质量金标准测试集。基于此基准,本文进一步提出了MathQ-Verify流水线,对数学问题进行细粒度解析,分解为原子假设和结论,通过一致性检查评估其语义严谨性。该流水线在检测有缺陷的问题方面实现了高精度,为清理噪声数学数据集提供了可靠基础。实验表明,MathQ-Verify在多个基准测试中实现了最先进的性能,相较于直接验证基线提高了最高可达25个百分点的F1分数。MathQ-Verify提供了可扩展且精确的数学数据集筛选解决方案,减少标签噪声,避免对无效问题的无效计算。我们的代码和数据已提供于https://github.com/OpenDCAI/MathQ-Verify。
引用
@article{arxiv.2505.13903,
title = {Let's Verify Math Questions Step by Step},
author = {Chengyu Shen and Zhen Hao Wong and Runming He and Hao Liang and Meiyi Qiang and Zimo Meng and Zhengyang Zhao and Bohan Zeng and Zhengzhou Zhu and Bin Cui and Wentao Zhang},
journal= {arXiv preprint arXiv:2505.13903},
year = {2026}
}