ExPe:具有外推能力的生成式 Transformer 模型精确位置编码
计算与语言
2025-10-06 v1
摘要
本文介绍了一种新颖的 Transformer 模型位置嵌入方法,名为“精确位置嵌入” (ExPE)。这是一种绝对位置嵌入方法,可以外推到比训练时更长的序列长度。传统的 Transformer 模型依赖绝对或相对位置嵌入将位置信息整合到词元嵌入中,这通常难以外推到比训练期间所见更长的序列。我们提出的方法利用一种新颖的嵌入策略,通过覆盖嵌入向量的特定维度来编码精确的位置信息,从而能够更精确地表示词元位置。所提出的方法不仅保持了原始嵌入的完整性,还增强了模型泛化到更长序列的能力。在因果语言建模中,当在比训练时更长的序列上进行测试时,我们的 ExPE 嵌入与旋转和正弦嵌入相比,显著降低了困惑度。
引用
@article{arxiv.2509.19569,
title = {ExPe: Exact Positional Encodings for Generative Transformer Models with Extrapolating Capabilities},
author = {Aleksis Datseris and Sylvia Vassileva and Ivan Koychev and Svetla Boytcheva},
journal= {arXiv preprint arXiv:2509.19569},
year = {2025}
}