中文

神经注意力:增强 Transformer 模型表达能力的新机制

机器学习 2025-11-10 v2 神经与进化计算

摘要

Transformer 模型通常使用点积计算注意力矩阵,这在捕获嵌入向量之间的非线性关系时存在局限性。我们提出了神经注意力(Neural Attention),一种用前馈网络替代点积的技术,能够实现对 token 之间关系的更具表达力的表示。该方法仅修改注意力矩阵的计算而保持矩阵维度不变,使其易于适配现有的基于 Transformer 的架构。我们提供了详细的数学论证,说明神经注意力为何能增加表示容量,并进行了对照实验以验证这一主张。在比较神经注意力与点积注意力时,在 WikiText-103 上的 NLP 实验显示困惑度降低了 2% 以上。类似地,在 CIFAR-10 和 CIFAR-100 上的实验显示,图像分类任务的准确率提高了 4 个百分点以上。尽管神经注意力引入了更高的计算需求,我们开发了缓解这些挑战的技术,确保在不牺牲其所提供的增强表达力的前提下保证实际可用性。这项工作确立了神经注意力作为增强 Transformer 模型在各种应用中预测能力的有效手段。所有实验的代码可在 https://github.com/awayfromzel/neural-attention-research 获取。

关键词

引用

@article{arxiv.2502.17206,
  title  = {Neural Attention: A Novel Mechanism for Enhanced Expressive Power in Transformer Models},
  author = {Andrew DiGiugno and Ausif Mahmood},
  journal= {arXiv preprint arXiv:2502.17206},
  year   = {2025}
}