大语言模型在数世界:测试其数值推理能力的快速方法
人工智能
2025-04-02 v1
摘要
人类数学推理的关键要素是我们的 number sense——一种对数字及其关系的抽象理解,使我们能够在有限的计算资源下解决涉及广泛数空间的问题。大型语言模型(LLMs)的数学推理通常在高层次问题(如奥林匹克挑战、几何、文字题和谜题)上进行测试,但其低层次的 number sense 鲜有探讨。我们引入“Numberland”,一个包含 100 个问题的测试,用于评估 LLM-based agents 的数值推理能力。这些任务——基本运算、高级计算(如指数、复数)、素数检查和 24 game——旨在测试基本技能及其在解决复杂和不确定问题中的集成。我们评估了五个 LLM-based agents:OpenAI 的 o1 和 o1-mini、Google Gemini、Microsoft Copilot 和 Anthropic Claude。它们在允许确定性步骤求解的前三个任务中得分在 74%-95% 之间。在需要 trial-and-error search 的 24 game 中,表现下降到 10%-73%。我们测试了最好的 24 求解器(o1 以 73% 的准确率)在 25 个更难问题上的得分,其得分下降到 27%,确认搜索是瓶颈。这些结果以及错误类型类型,表明 LLMs 的 number sense 相当脆弱,这在它们在挑战性基准测试中表现出色的事实下颇具惊讶。LLMs 数值推理的局限性凸显了简单、针对性测试的重要性,以确保 LLM 数学技能的安全使用。
引用
@article{arxiv.2504.00226,
title = {Large Language Models in Numberland: A Quick Test of Their Numerical Reasoning Abilities},
author = {Roussel Rahman},
journal= {arXiv preprint arXiv:2504.00226},
year = {2025}
}