Transformer模型中位置编码的理论分析:对表达力和泛化能力的影响
机器学习
2025-06-10 v1 人工智能
摘要
位置编码是基于Transformer的模型中的核心组成部分,通过消除 recurrence 机制来处理序列数据。本文提出了一套理论框架,用于分析各种位置编码方法(包括正弦编码、学习型编码、相对编码以及类似注意力线性偏置(ALiBi)的偏置型方法)对Transformer表达力、泛化能力以及对更长序列的外推能力的影响。通过函数逼近定义表达力,使用辛达赫克复杂度建立泛化界限,提出基于正交函数(如小波和勒让德多项式)的新型编码方法。分析了现有和新型编码的外推能力,将ALiBi的偏置方法扩展到统一的理论语境中。在合成序列到序列任务上的实验评估表明,基于正交变换的编码在泛化和外推方面优于传统正弦编码。本工作填补了Transformer理论中的关键空白,为自然语言处理、计算机视觉及其他Transformer应用中的设计选择提供了洞见。
引用
@article{arxiv.2506.06398,
title = {Theoretical Analysis of Positional Encodings in Transformer Models: Impact on Expressiveness and Generalization},
author = {Yin Li},
journal= {arXiv preprint arXiv:2506.06398},
year = {2025}
}