大语言模型学习数字的通用表征及其背后的原因
计算与语言
2026-04-23 v2 人工智能
机器学习
神经与进化计算
摘要
先前的研究表明,大型语言模型(LLM)往往会收敛到基于正弦表示的准确输入嵌入来表示数字。在本工作中,我们量化了这些表征实际上是极其系统化的,几乎可以完美地通用:不同的LLM家族发展出等效的正弦结构,数字表征在大范围实验设置中具有广泛的可互换性。我们展示,充分考虑这一特征对于评估LLM对数字及其他序数信息的编码准确性至关重要,机械地增强这种正弦性也可能导致LLM算术错误的减少。
引用
@article{arxiv.2510.26285,
title = {Language Models Learn Universal Representations of Numbers and Here's Why You Should Care},
author = {Michal Štefánik and Timothee Mickus and Marek Kadlčík and Bertram Højer and Michal Spiegel and Raúl Vázquez and Aman Sinha and Josef Kuchař and Philipp Mondorf and Pontus Stenetorp},
journal= {arXiv preprint arXiv:2510.26285},
year = {2026}
}