为何“经典”Transformer 难以加深及其深层化方法
机器学习
2024-02-05 v2 人工智能
神经与进化计算
摘要
自 2017 年问世以来,Transformer 已成为领先的神经网络架构,催化了众多人工智能领域的革命性进展。Transformer 的关键创新在于其旨在捕获上下文信息的自注意力(SA)机制。然而,将原始的 Transformer 设计扩展到更深的模型已被证明极具挑战性,甚至难以实现。尽管已提出多种修改方案以将更多层 SA 机制堆叠到更深的模型中,但对这一深度问题的全面理解仍然缺乏。本文从理论和实验两方面进行了全面研究,以证实深度问题是由“令牌相似性升级”引起的;即,经过 SA 机制的反复应用,令牌变得越来越相似。我们的分析揭示,在注意力矩阵的不变主导特征空间和大谱间隙的驱动下,令牌相似性以线性速率可证明地升级。基于所获得的洞察,我们提出了一种通过外科手术式地移除过度相似性的新策略,这与现有显式或隐式削弱 SA 机制的方法(例如 pre-norm Transformer 中的做法)形成对比。初步实验结果证实了所提策略在小规模 post-norm Transformer 模型中的有效性。
引用
@article{arxiv.2312.06182,
title = {Why "classic" Transformers are shallow and how to make them go deep},
author = {Yueyao Yu and Yin Zhang},
journal= {arXiv preprint arXiv:2312.06182},
year = {2024}
}