位置嵌入在长度广义中的局限性与能力
机器学习
2025-10-07 v1 人工智能
摘要
在Transformer模型中,位置嵌入(Position Embeddings, PEs)显著影响长度广义(Length Generalization, LG)性能,但其根本作用仍不清晰。本文探讨了PEs在实现LG方面的局限性与能力。我们对PEs在位置唯一线性注意力(Position-Only Linear Attentions, POLAs)中的情况进行理论分析,引入线性表示复杂度(Linear Representation Complexity, LRC)来刻画PEs何时能够实现LG。我们的分析表明,PEs并不扩展计算能力,但结构化了跨位置的学习计算。 extending到实际Transformer后,我们提出顺序表示复杂度(Sequential Representation Complexity, SRC),并推断LG当且仅当SRC在不同尺度下保持不变时才可能实现。我们通过各种推理任务中的实证证据支持这一假设。为增强LG,我们引入Scale Hint,允许灵活的实例尺度调整,以及一种基于学习的位置嵌入框架,自动学习位置关系。我们的工作提供了理论见解和实用策略,以提高Transformer中的LG性能。
关键词
引用
@article{arxiv.2510.04130,
title = {On the Limitations and Capabilities of Position Embeddings for Length Generalization},
author = {Yang Chen and Yitao Liang and Zhouchen Lin},
journal= {arXiv preprint arXiv:2510.04130},
year = {2025}
}