中文

面向 Transformer 语言模型的值感知数值表示

计算与语言 2026-01-15 v1 人工智能 机器学习

摘要

基于 Transformer 的语言模型在数学推理基准上常取得优异结果,但在基本数值理解和算术运算上仍然脆弱。一个核心限制是数字被处理为符号化 token,其嵌入并未显式编码数值大小,从而导致系统性错误。我们引入一种值感知的数值表示,通过一个专用的前缀 token 来增强标准的 token 化输入,该 token 的嵌入显式地以底层数值为条件。这种机制将量级信息直接注入模型的输入空间,同时保持与现有分词器和仅解码器 Transformer 架构的兼容性。在算术任务上的评估表明,所提出的方法在数值格式、任务和操作数长度方面均优于基线模型。这些结果表明,显式编码数值是提高语言模型基本数值鲁棒性的有效且高效的方法。

关键词

引用

@article{arxiv.2601.09706,
  title  = {Value-Aware Numerical Representations for Transformer Language Models},
  author = {Andreea Dutulescu and Stefan Ruseti and Mihai Dascalu},
  journal= {arXiv preprint arXiv:2601.09706},
  year   = {2026}
}