CogMath:从人类认知视角评估 LLM 的真实数学能力
人工智能
2025-06-06 v1
摘要
虽然大型语言模型 (LLM) 在解决复杂数学任务方面显示出前景,但现有的评估范式仅依赖整体答案准确率的粗糙度度量,这些度量不足以评估其真实能力。本文提出了 CogMath,通过人类认知的视角全面评估 LLM 的数学能力。具体而言,灵感来自心理学理论,CogMath 将人类推理过程形式化为三个阶段:问题理解、问题解决和解答总结。在这些阶段中,我们探讨了诸如数值计算、知识和反事实等视角,设计了 9 个细粒度评估维度。在每个维度上,我们开发了一个“询问-判断-参考”多主体系统,用于生成评估 LLM 在该维度掌握程度的询问。只有当 LLM 在 9 个维度的所有询问中表现出色时,才认为其真正掌握了该问题。通过对三个基准测试应用 CogMath,我们发现 7 个主流 LLM 的数学能力被高估了 30%~40%。此外,我们在具体阶段/维度上定位了其优势与不足,为进一步提升其推理能力提供了深入见解。
引用
@article{arxiv.2506.04481,
title = {CogMath: Assessing LLMs' Authentic Mathematical Ability from a Human Cognitive Perspective},
author = {Jiayu Liu and Zhenya Huang and Wei Dai and Cheng Cheng and Jinze Wu and Jing Sha and Song Li and Qi Liu and Shijin Wang and Enhong Chen},
journal= {arXiv preprint arXiv:2506.04481},
year = {2025}
}