中文

大语言模型学习数字的通用表征及其背后的原因

计算与语言 2026-04-23 v2 人工智能 机器学习 神经与进化计算

摘要

先前的研究表明,大型语言模型(LLM)往往会收敛到基于正弦表示的准确输入嵌入来表示数字。在本工作中,我们量化了这些表征实际上是极其系统化的,几乎可以完美地通用:不同的LLM家族发展出等效的正弦结构,数字表征在大范围实验设置中具有广泛的可互换性。我们展示,充分考虑这一特征对于评估LLM对数字及其他序数信息的编码准确性至关重要,机械地增强这种正弦性也可能导致LLM算术错误的减少。

关键词

引用

@article{arxiv.2510.26285,
  title  = {Language Models Learn Universal Representations of Numbers and Here's Why You Should Care},
  author = {Michal Štefánik and Timothee Mickus and Marek Kadlčík and Bertram Højer and Michal Spiegel and Raúl Vázquez and Aman Sinha and Josef Kuchař and Philipp Mondorf and Pontus Stenetorp},
  journal= {arXiv preprint arXiv:2510.26285},
  year   = {2026}
}