尺度不变注意力机制
计算与语言
2025-12-18 v2 机器学习
机器学习
摘要
大语言模型研究中,一个持续存在的挑战是开发能够从短上下文训练中泛化至推理中长上下文的注意力机制。本文提出两种条件:尺度不变的总注意力与尺度不变的注意力稀疏性。我们在高斯假设下表明,注意力 logit 的一种简单位置相关变换即可满足上述条件。实验表明,所提出的尺度不变注意力方案在零样本情况下从短上下文泛化至长上下文时,能显著降低验证损失,并且在长程上下文检索方面效果显著。
引用
@article{arxiv.2505.17083,
title = {Scale-invariant Attention},
author = {Ben Anson and Xi Wang and Laurence Aitchison},
journal= {arXiv preprint arXiv:2505.17083},
year = {2025}
}
备注
Accepted at Neurips 2025