中文

Softplus 注意力配合重加权提升大语言模型的长度外推能力

计算与语言 2026-02-02 v5 人工智能 机器学习

摘要

大语言模型近年来因自注意力机制取得了显著的成功。然而,传统 Softmax 注意力在推理 token 数量增加时存在数值不稳定和性能下降的问题。本工作通过提出注意力的新设计原则来解决这些问题,将其视为两个阶段的过程。第一个阶段(归一化)通过用更数值稳定的 Softplus 取代 Softmax 并采用 l1l_{1}-归一化来改进标准注意力。此外,我们引入基于不变熵的动态尺度因子。我们展示,这种新型注意力机制超越了常规 Softmax 注意力和最先进的无 Softmax 替代方案。我们的第二个提议是引入第二个处理阶段(锐化),包括一种重加权机制,以放大显著注意力权重同时削弱较弱的权重。这使模型能够更有效地聚焦于相关 token,缓解注意力沉淀现象,从而根本性地提高长度外推能力。这种新型的、两个阶段的自注意力替代方案被证明能够确保数值稳定性并显著提高长度外推能力,在训练长度的 16 倍下保持验证损失几乎恒定,同时在具有挑战性的长上下文检索任务和下游基准测试中取得优异成绩。此外,符号回归实验表明,我们的方法使模型能够从轨道轨迹序列中恢复牛顿引力定律,提供了恰当注意力机制对于基础模型发展出真正物理世界模型的证据。

关键词

引用

@article{arxiv.2501.13428,
  title  = {Softplus Attention with Re-weighting Boosts Length Extrapolation in Large Language Models},
  author = {Bo Gao and Michael W. Spratling and Letizia Gionfrida},
  journal= {arXiv preprint arXiv:2501.13428},
  year   = {2026}
}

备注

32 pages for ICML 2026