中文

注意力机制中双向跨度与跨度违例的缩放

机器学习 2025-12-16 v1 人工智能 计算与语言

摘要

标准的 O(N2)O(N^2) Transformer 仍然是序列建模的经验性能前沿,通过解决几何效率低下的问题可以进一步优化其训练。我们提出了一个优化框架,该框架利用非对称投影将反向传播梯度分解为平行跨度和正交违例,同时保持标准的前向传播 QKVQKV 结构不变。通过对各种分解和投影设置进行一致的实验验证,我们提供了强有力的理论证据:标准注意力梯度是次优的。我们证明,选择性地缩放这些组件,主要关注 0th0^{th} 阶双向平行跨度,能产生最有效的学习信号。在有限的 WikiText-2 数据集上,使用粗糙的配置,该方法实现了 0.56%0.56\% 的验证损失降低,证实了该框架的基本有效性,并暗示在更大数据集和更深训练机制上的显著潜在收益。

关键词

引用

@article{arxiv.2512.13033,
  title  = {Scaling Bidirectional Spans and Span Violations in Attention Mechanism},
  author = {Jongwook Kim and Sangheon Yun and Sukjin Yoon},
  journal= {arXiv preprint arXiv:2512.13033},
  year   = {2025}
}