稀疏注意力下的长程上下文泛化
计算与语言
2026-03-03 v4 人工智能
摘要
Transformer-based 架构通常采用 softmax 计算注意力权重,产生对序列中所有 token 的密集分布。虽然在许多设置下有效,但这种稠密性被证明对需要精确聚焦于固定大小模式的任务不利:随着序列长度增加,非信息性 token 会累积注意力概率质量,导致分布扩散和表示坍缩。我们在本文中表明,使用 -entmax 的动态稀疏注意力机制可避免这些问题,由于其为无关 token 分配确切零的能力。此外,我们引入自适应可扩展 entmax(ASEntmax),为 -entmax 引入可学习的温度参数,使注意力分布能够在稀疏(模式聚焦)和密集(softmax-like)区间之间插值。我们的实验评估在合成任务和语言建模上,表明 ASEntmax 在softmax、可扩展softmax以及固定温度 -entmax基线方面显著优于后者,在合成基准上实现最长达 1000 的长度外推,在语言建模中实现更好的长程上下文泛化,同时保持短程上下文性能,包括更好的困惑度趋势和在训练长度 8 处的更高检索准确率。
引用
@article{arxiv.2506.16640,
title = {Long-Context Generalization with Sparse Attention},
author = {Pavlo Vasylenko and Hugo Pitorro and André F. T. Martins and Marcos Treviso},
journal= {arXiv preprint arXiv:2506.16640},
year = {2026}
}
备注
ICLR 2026