注意力机制中双向跨度与跨度违例的缩放
机器学习
2025-12-16 v1 人工智能
计算与语言
摘要
标准的 Transformer 仍然是序列建模的经验性能前沿,通过解决几何效率低下的问题可以进一步优化其训练。我们提出了一个优化框架,该框架利用非对称投影将反向传播梯度分解为平行跨度和正交违例,同时保持标准的前向传播 结构不变。通过对各种分解和投影设置进行一致的实验验证,我们提供了强有力的理论证据:标准注意力梯度是次优的。我们证明,选择性地缩放这些组件,主要关注 阶双向平行跨度,能产生最有效的学习信号。在有限的 WikiText-2 数据集上,使用粗糙的配置,该方法实现了 的验证损失降低,证实了该框架的基本有效性,并暗示在更大数据集和更深训练机制上的显著潜在收益。
关键词
引用
@article{arxiv.2512.13033,
title = {Scaling Bidirectional Spans and Span Violations in Attention Mechanism},
author = {Jongwook Kim and Sangheon Yun and Sukjin Yoon},
journal= {arXiv preprint arXiv:2512.13033},
year = {2025}
}