中文

SMRC:与学生推理对齐以纠正数学错误的大语言模型

计算与语言 2025-11-19 v1

摘要

大语言模型(LLM)在解决数学问题时常常会出现推理错误,如何自动检测和纠正这些错误已成为重要的研究方向。然而,现有方法主要关注模型内部的自我纠正,远不够符合教育环境中所需的“教师式”纠正,即系统性地引导和修订学生的解题过程。为此,我们提出了一种新方法:SMRC(Student Mathematical Reasoning Correction),即将大语言模型与学生推理对齐。具体而言,SMRC将学生推理建模为多步骤序列决策问题,引入蒙特卡洦树搜索(MCTS)以探索最优的纠正路径。为减少注释过程级奖励的成本,我们利用广度优先搜索(BFS)结合LLM和最终答案评估生成奖励信号,并通过反向传播机制将奖励分配到中间推理步骤,从而实现细粒度的过程监督。此外,我们构建了一个针对高中数学的基准数据集MSEB(Multi-Solution Error Benchmark),包含158个实例,包括问题陈述、学生解答和正确的推理步骤。我们进一步提出了以解决方案准确性和正确步骤保留率为核心的双重评估协议,提供了对教育可用性的全面衡量。实验结果表明,SMRC在ProcessBench和 MR-GSM8K两个公开数据集以及我们自己的MSEB上在有效性和整体性能方面显著优于现有方法。代码和数据已公开于https://github.com/Mind-Lab-ECNU/SMRC。

关键词

引用

@article{arxiv.2511.14684,
  title  = {SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction},
  author = {Biaojie Zeng and Min Zhang and Juan Zhou and Fengrui Liu and Ruiyang Huang and Xin Lin},
  journal= {arXiv preprint arXiv:2511.14684},
  year   = {2025}
}

备注

13 pages, 3 figures