变换器意味着什么?基于理论 Hessian 分析的洞见
机器学习
2025-03-18 v2 机器学习
摘要
变换器架构无可辩驳地革新了深度学习,超越了多层感知器(MLP)与卷积神经网络(CNN)等经典架构。在其核心,注意力模块在形式与功能上区别于深度学习中大多数其他构件——以至于变换器常伴随自适应优化器、层归一化、学习率 warmup 等措施。背后根本原因及其精确机制至今鲜为人知。本文通过对单层自注意力机制的 Hessian 进行理论比较,填补这一鸿沟,深入阐释变换器区别于其他架构的根本原因。具体而言,(a)我们首先完整推导变换器的 Hessian 并以矩阵导数形式表达;(b)随后以数据、权重与注意力矩的依赖性进行表征;(c)在此过程中进一步凸显其与经典网络 Hessian 结构差异的关键。我们的结果表明,变换器常见的各种架构与优化选择,皆可追溯至其对数据矩阵与权重矩阵高度非线性依赖——这种依赖在参数间呈异质分布。最终,我们的发现为深化对变换器独特优化景观的理解,以及所致挑战的本质,提供了坚实依据。
关键词
引用
@article{arxiv.2410.10986,
title = {What Does It Mean to Be a Transformer? Insights from a Theoretical Hessian Analysis},
author = {Weronika Ormaniec and Felix Dangel and Sidak Pal Singh},
journal= {arXiv preprint arXiv:2410.10986},
year = {2025}
}