FoNE:通过傅里叶特征实现精确的单 token 数字嵌入
计算与语言
2026-04-22 v2 机器学习
摘要
大型语言模型(LLMs)通常使用多个 token 表示数字,这需要模型聚合这些 token 才能解释数值。这种碎片化既影响训练和推理效率,也不利于模型在与数字相关的任务中的性能。我们观察到预训练 LLM 在数字 token 内部学习类傅里叶特征,因此我们提出了傅里叶数字嵌入(FoNE)方法,直接将数字映射到嵌入空间中,其傅里叶特征被捕获。FoNE 将每个数字编码为单个 token,仅需每个数字两个嵌入维度,有效地捕获数值而无需碎片化。这一紧凑表示加速了训练和推理。与传统子词和逐位嵌入相比,FoNE 不仅降低了计算开销,还在各种数值任务(包括加法、减法和乘法)中实现更高的准确率。在 6 位十进制加法任务中,FoNE 只需传统子词和逐位嵌入的 1/64 数据即可实现 99% 准确率,同时使用 3 倍和 6 倍更少的 token 表示每个数字。此外,FoNE 是唯一一种在超过 10 万个测试示例上实现加、减、乘 100% 准确率的方法。代码和可视化工具可在 https://fouriernumber.github.io/ 获取。
引用
@article{arxiv.2502.09741,
title = {FoNE: Precise Single-Token Number Embeddings via Fourier Features},
author = {Tianyi Zhou and Deqing Fu and Mahdi Soltanolkotabi and Robin Jia and Vatsal Sharan},
journal= {arXiv preprint arXiv:2502.09741},
year = {2026}
}