基于随机矩阵理论的多头潜在注意力学习动力学分析
机器学习
2025-07-15 v1
摘要
本文研究了多头潜在注意力(Multi-head Latent Attention, MLA)——一种流行的键/值记忆压缩策略——如何影响变换器在预训练期间的内部容量。我们采用轻量级的马兆chauff-帕斯ur(Marchenko-Pastur, MP)诊断工具,对训练过程中 gram 矩阵的谱进行分析,比较了三个变体:标准多头注意力(Multi-head Attention, MHA)基线、应用旋转嵌入的MLA-PreRoPE,以及共享单个旋转子向量的所有头的MLA-Decoupled。我们的随机矩阵分析揭示了三个关键发现:\textbf{i)} 容量瓶颈在局部出现:MHA 和 MLA-PreRoPE 均表现出特定图层中出现的尖锐、早期尖峰,这些尖峰持续存在并向上传播,扰乱了 bulk 与 outlier 方向之间的平衡;\textbf{ii)} 这些尖峰与秩崩溃相吻合,将模型的表达能力集中到狭窄子空间中;\textbf{iii)} 只有解耦变体可防止这一级联效应,保持广泛的谱支持并抑制跨图层的 outlier 形成。这些结果强调,\emph{旋转嵌入的应用方式} 与 \emph{压缩位置} 同样关键。共享旋转分量可减轻谱片段化,保留表示容量。
引用
@article{arxiv.2507.09394,
title = {A Random Matrix Theory Perspective on the Learning Dynamics of Multi-head Latent Attention},
author = {Nandan Kumar Jha and Brandon Reagen},
journal= {arXiv preprint arXiv:2507.09394},
year = {2025}
}
备注
ICML 2025 Workshop on High-dimensional Learning Dynamics (HiLD)