Transformer 归一化层与语义子空间的独立性
机器学习
2024-06-27 v1 人工智能
摘要
最近的研究表明,Transformer 可以通过内部执行称为电路的计算图来解决情境推理任务。电路通常使用注意力机制来逻辑匹配表示的子空间,例如使用序列位置来识别前一个标记。在本文中,我们将语义子空间定义为任何能够完全确定注意力分布的表示的独立子空间。我们展示,Pre-Norm(即面向当前 Transformer 所使用的归一化层的放置)除非模型学习了严格的正交球表示结构,否则违反了这种能力。这是因为它导致通过其共同归一化因子的线性子空间发生干扰。从理论上讲,我们通过将这种干扰建模为对查询/键/值向量 -范数的随机噪声来分析电路稳定性,预测当稀疏注意力从一个标记转移到另一个标记时,会出现电路坍塌的现象。实验方面,我们检讨了针对实际模型训练的数学加法任务的敏感性,观察到当范数人工扰动约 10% 时,约 1% 的电路坍塌率。我们对比了 Pre-Norm 与 QKV-Norm,后者在注意力头的线性算子之后放置归一化。理论上,这放宽了表示约束。实验上我们观察到在分布内表现相当,但在分布外表现更差。
关键词
引用
@article{arxiv.2406.17837,
title = {Transformer Normalisation Layers and the Independence of Semantic Subspaces},
author = {Stephen Menary and Samuel Kaski and Andre Freitas},
journal= {arXiv preprint arXiv:2406.17837},
year = {2024}
}