中文

位置即概率:超越训练长度进行外推的自监督 Transformer

机器学习 2025-12-24 v2 人工智能 计算与语言 神经与进化计算

摘要

当测试序列显著超出训练长度时,深度序列模型通常在准确率上出现下降,然而许多关键任务——如算法推理、多步算术和组合泛化——需要鲁棒的长度外推。我们提出了 PRISM,一种概率相对位置隐式叠加模型(Probabilistic Relative-position Implicit Superposition Model),这是一种新颖的位置编码机制,使 Transformer 能够准确外推至其训练长度 10 倍以上的范围。PRISM 通过可微的直方图滤波器更新学习连续的相对位置,通过概率叠加而非传统的确定性嵌入来保持位置不确定性。在经验上,PRISM 实现了最先进的长度外推,成功泛化至算法基准(包括算术(加法、乘法)、SCAN 组合性任务,以及源自 DeepMind 最新数据集的复杂复制变体)中此前难以处理的序列长度。我们的分析表明,PRISM 的随机位置编码保持了清晰且可解释的内部状态,为可靠的长度泛化提供了理论基础。这些结果推进了神经序列模型的目标,使其在远超训练视界的长度下仍保持算法上的鲁棒性。

关键词

引用

@article{arxiv.2506.00920,
  title  = {Position as Probability: Self-Supervised Transformers that Think Past Their Training for Length Extrapolation},
  author = {Philip Heejun Lee},
  journal= {arXiv preprint arXiv:2506.00920},
  year   = {2025}
}

备注

Note: v2: working paper; code, additional baselines, ablations, will follow in v3