中文

从插值到外推:算术Transformer的完全长度泛化

机器学习 2024-05-13 v3 计算与语言

摘要

本文研究Transformer模型学习算术算法(如加法与奇偶性)的内在能力。通过实验与注意力分析,我们确定了实现最优长度泛化的一系列关键因素。我们表明,在针对性注意力偏置的帮助下,Transformer模型能够泛化到更长长度。特别地,我们的方案解决了Parity任务——一个已知且被理论证明为Transformer失败模式的任务。我们随后引入注意力偏置校准(Attention Bias Calibration, ABC),这是一个使模型自动学习恰当注意力偏置的校准阶段,我们展示其与相对位置编码中的机制相关联。我们证明使用ABC,Transformer模型能在特定算术任务上实现前所未有的近完美长度泛化。此外,我们展示ABC与RPE和LoRA具有显著相似性,这可能暗示其在更复杂任务上的应用潜力。

关键词

引用

@article{arxiv.2310.11984,
  title  = {From Interpolation to Extrapolation: Complete Length Generalization for Arithmetic Transformers},
  author = {Shaoxiong Duan and Yining Shi and Wei Xu},
  journal= {arXiv preprint arXiv:2310.11984},
  year   = {2024}
}