中文

Number Cookbook:语言模型的数字理解及提升方法

计算与语言 2025-03-06 v3 人工智能

摘要

大语言模型(LLMs)能够解决越来越多的复杂推理任务,但在基本的数字理解和处理方面(如 9.11 > 9.9)会犯令人惊讶的错误。后一种能力对于处理复杂的算术和数学问题至关重要,也是大多数推理任务的基础,但先前的工作对此关注甚少,或仅讨论了几个受限任务(如整数加法)。本文全面研究了 LLMs 的数字理解和处理能力(NUPA)。首先,我们引入了一个基准,涵盖四种常见数字表示和四个主要类别中的 17 种不同数字任务,共产生 41 个有意义的组合。这些任务源自中小学课程,涵盖几乎所有日常数字理解和处理场景,且这些任务的规则非常简单明了。通过该基准,我们发现当前 LLMs 在许多任务上频繁失败。为了研究该问题,我们使用现有的和潜在的增强 NUPA 的技术(如分词器、位置编码和数字格式)训练小模型,使用我们的测试平台全面评估其有效性。我们还在我们提出的 NUPA 任务上微调了实际规模的 LLMs,发现 1)朴素微调可以在许多但并非所有任务上显著提升 NUPA,2)令人惊讶的是,旨在增强 NUPA 的技术在微调预训练模型时证明是无效的。我们进一步探讨了思维链技术对 NUPA 的影响。我们的工作提供了对 LLMs 中 NUPA 更详细和全面的理解。我们的基准和代码发布在 https://github.com/GraphPKU/number_cookbook。

关键词

引用

@article{arxiv.2411.03766,
  title  = {Number Cookbook: Number Understanding of Language Models and How to Improve It},
  author = {Haotong Yang and Yi Hu and Shijia Kang and Zhouchen Lin and Muhan Zhang},
  journal= {arXiv preprint arXiv:2411.03766},
  year   = {2025}
}

备注

ICLR 2025 poster