解构注意力机制:探究有效语言建模的设计原则
计算与语言
2025-10-14 v1 机器学习
摘要
Transformer 语言模型的成功被广泛归因于其点积注意力机制,后者融合了一系列关键设计原则:跨位置混合信息(实现多 token 交互)、序列相关激活(注意力权重针对每个输入进行自适应)、特定的数学形式(点积相似度加上 softmax 加权)以及查询与键的耦合与演化的隐藏状态(将注意力锚定在当前层)。然而,这些原则的必要性仍 largely 未被充分检验。本文通过设计受控变体来系统性地解构注意力机制,选择性地放宽这些原则,可同时应用于所有层,或在混合架构中仅部分层保留标准注意力。我们的实证分析表明,混合 token 的机制是必不可少的,因为其缺失会导致模型接近随机行为;而精确的数学形式和序列依赖性可以在仅保留部分层的情况下得到显著放宽。意外地的是,即使某些变体在单独使用时表现不佳,仅在与标准注意力交替使用时也能实现稳健的性能,凸显了合作效应。这些发现深化了我们对注意力有效性之本的理解,为在不牺牲性能的前提下简化语言模型提供了新思路。
关键词
引用
@article{arxiv.2510.11602,
title = {Deconstructing Attention: Investigating Design Principles for Effective Language Modeling},
author = {Huiyin Xue and Nafise Sadat Moosavi and Nikolaos Aletras},
journal= {arXiv preprint arXiv:2510.11602},
year = {2025}
}