暴露数学能力差距:评估大型语言模型基础数值能力的基准测试
计算与语言
2025-06-04 v2 人工智能
摘要
大型语言模型(LLMs)在自然语言处理任务(如文本生成和语义理解)方面展现了令人印象深刻的能力。然而,它们在数值推理任务(如基础算术、数值检索和量级比较)上的表现仍然出奇地差。这一差距源于它们依赖表面层次的统计模式而非将数字理解为连续量值。现有基准测试主要关注语言能力或结构化数学问题求解,忽视了真实场景中所需的基础数值推理。为弥补这一差距,我们提出了 NumericBench,一个全面评估六种基础数值能力的基准测试:数字识别、算术运算、上下文检索、比较、摘要和逻辑推理。NumericBench 包含从合成数字列表到爬取的真实世界数据的数据集,应对长上下文、噪声和多步推理等挑战。在 GPT-4 和 DeepSeek 等最先进 LLMs 上的广泛实验揭示了数值推理中的持续弱点,凸显了改进数值感知语言建模的紧迫性。该基准测试发布于:https://github.com/TreeAI-Lab/NumericBench。
引用
@article{arxiv.2502.11075,
title = {Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models},
author = {Haoyang Li and Xuejia Chen and Zhanchao XU and Darian Li and Nicole Hu and Fei Teng and Yiming Li and Luyu Qiu and Chen Jason Zhang and Qing Li and Lei Chen},
journal= {arXiv preprint arXiv:2502.11075},
year = {2025}
}
备注
Accepted by ACL 2025