从盲求解者到逻辑思考者:衡量大语言模型在错误数学问题中的逻辑完整性
计算与语言
2025-04-08 v2 人工智能
计算机科学中的逻辑
摘要
考虑以下数学题:“Lily 昨天收到最好朋友的 3 块饼干,早餐吃了 5 块。今天,她的朋友又给了她 3 块饼干。Lily 现在有多少块饼干?”许多之前的研究中使用的大语言模型(LLMs)通过方程“3 - 5 + 3”计算出答案“1”。然而,从人类视角看,我们认识到这个问题固有缺陷:Lily 初始只有 3 块饼干,却要吃掉 5 块。这一差异引出关键问题:当前的大语言模型是否仅是盲求解者,即在没有深层推理的情况下应用数学运算,还是可以作为逻辑思考者,能够识别逻辑不一致?为探索这一问题,我们提出了一个基准数据集 FaultyMath,包含丰富多样的错误数学问题:i)多个数学范畴,如代数、几何、数论等,ii)不同难度水平,iii)不同类型的错误——从违反常识和模糊表述到数学矛盾等。我们评估了包括开源、封闭和数学专用模型在内的广泛 LLM 在 FaultyMath 上的表现,从三个维度进行评估:i)模型在未被明确提示识别错误数学问题时的准确性如何?ii)在提供关于问题有效性的提示(正确或误导性)时,LLM 如何适应成为可靠的逻辑思考者?iii)当 LLM 识别出数学问题有缺陷时,其生成的解释有多可信?通过大量实验和详细分析,我们的结果表明,现有的 LLM 大多功能于盲求解者,不足以具备作为逻辑思考者所需的推理能力。
引用
@article{arxiv.2410.18921,
title = {From Blind Solvers to Logical Thinkers: Benchmarking LLMs' Logical Integrity on Faulty Mathematical Problems},
author = {A M Muntasir Rahman and Junyi Ye and Wei Yao and Sierra S. Liu and Jesse Yu and Jonathan Yu and Wenpeng Yin and Guiling Wang},
journal= {arXiv preprint arXiv:2410.18921},
year = {2025}
}