LLM 无法发现数学错误,即使允许其窥探解答
计算与语言
2025-09-03 v1 人工智能
摘要
大语言模型(LLM)在数学应用题上表现出色,但已被证明在诸如识别学生解答中的错误等元推理任务上存在困难。在这项工作中,我们利用两个错误推理数据集 VtG 和 PRM800K,研究了在分步解答中定位首个错误步骤的挑战。我们的实验表明,即使允许访问参考解答,最先进的 LLM 仍难以定位学生解答中的首个错误步骤。为此,我们提出了一种生成中间修正版学生解答的方法,使其与原始学生解答更为对齐,这有助于提升性能。
引用
@article{arxiv.2509.01395,
title = {LLMs cannot spot math errors, even when allowed to peek into the solution},
author = {KV Aditya Srivatsa and Kaushal Kumar Maurya and Ekaterina Kochmar},
journal= {arXiv preprint arXiv:2509.01395},
year = {2025}
}
备注
Accepted to EMNLP 2025