中文

SenseMath:评估大语言模型的数感:shortcut 使用、判断与生成

人工智能 2026-04-03 v1

摘要

大型语言模型常常在可供选择的高效数值shortcut 可用时仍默认采用逐步计算。这引出了一个基本问题:它们是否在类人行为意义上表现出数感,即识别数值结构、在恰当时应用shortcut 以及在其不适用时避免它们的能力?我们提出 SenseMath,一个受控基准,用于评估 LLM 中结构敏感的数值推理。SenseMath 包含 4800 项,涵盖八类shortcut 类别和四个数字尺度,包含匹配的 strong-shortcut、weak-shortcut 和 control 变体。它支持三种评估设置,层级递增:shortcut 使用(模型是否在shortcut 可用的问题上应用shortcut);适用性判断(模型是否识别shortcut 何时恰当或误导);以及问题生成(模型是否生成正确接受给定类型shortcut 的新问题项目)。我们在从 GPT-4o-mini 到 Llama-3.1-8B 的五个 LLM 上进行评估,发现一致模式:在明确提示下,模型轻易采纳shortcut 策略,在shortcut 可用的项目上实现显著准确率提升(最高可达 15%),但在标准链式思考提示下,只有不到 40% 的情况自然采用此类策略,尽管它们显然具备所需能力。此外,这种能力仅限于 Use 级别;模型系统性地将shortcut 应用于其不适用的问题,且未能从头生成有效的包含shortcut 的问题。综合这些结果表明,当前 LLM 具备程序化的shortcut 流利性,但缺乏理解 shortcut 何时以及为何有效的结构性理解,这构成了人类数感的核心。

关键词

引用

@article{arxiv.2604.01988,
  title  = {SenseMath: Do LLMs Have Number Sense? Evaluating Shortcut Use, Judgment, and Generation},
  author = {Haomin Zhuang and Xiangqi Wang and Yili Shen and Ying Cheng and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2604.01988},
  year   = {2026}
}