DAG-Math:基于图式思维引导的大语言模型数学推理
人工智能
2026-03-03 v2 机器学习
摘要
大语言模型(LLMs)在链式思维(CoT)提示下在数学问题上表现出强大的性能,但仍不清楚这种成功是源于搜索、记忆程序还是规则一致的推理。为此,我们提出将CoT建模为在有向无环图(DAG)上进行的基于规则的随机过程,其中节点代表中间推导状态,边编码规则应用。在此框架中,我们引入了逻辑接近性指标,用于量化模型的CoT轨迹(即LLM的最终输出)是否遵循DAG结构,从而提供超越经典PASS@指标的评估。基于此,我们引入DAG-MATH CoT格式并构建了一个引导LLMs生成该格式CoT轨迹的基准,从而实现对其推理能力在我们框架下的评估。在标准数学推理数据集上,我们的分析揭示了即使在PASS@相当的情况下,代表性LLM家族之间在推理忠实度上存在统计显著差异,凸显了最终答案准确性与规则一致推导之间的差距。我们的框架在自由形式CoT和形式证明系统之间提供了平衡,为LLM推理评估提供了可操作的诊断工具。我们的基准和代码已在https://github.com/YuanheZ/DAG-MATH 上提供。
引用
@article{arxiv.2510.19842,
title = {DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs},
author = {Yuanhe Zhang and Ilja Kuzborskij and Jason D. Lee and Chenlei Leng and Fanghui Liu},
journal= {arXiv preprint arXiv:2510.19842},
year = {2026}
}
备注
Accepted by ICLR 2026