中文

基于随机矩阵理论的多头潜在注意力学习动力学分析

机器学习 2025-07-15 v1

摘要

本文研究了多头潜在注意力(Multi-head Latent Attention, MLA)——一种流行的键/值记忆压缩策略——如何影响变换器在预训练期间的内部容量。我们采用轻量级的马兆chauff-帕斯ur(Marchenko-Pastur, MP)诊断工具,对训练过程中 WQWKW_{Q}W_{K}^\top gram 矩阵的谱进行分析,比较了三个变体:标准多头注意力(Multi-head Attention, MHA)基线、应用旋转嵌入的MLA-PreRoPE,以及共享单个旋转子向量的所有头的MLA-Decoupled。我们的随机矩阵分析揭示了三个关键发现:\textbf{i)} 容量瓶颈在局部出现:MHA 和 MLA-PreRoPE 均表现出特定图层中出现的尖锐、早期尖峰,这些尖峰持续存在并向上传播,扰乱了 bulk 与 outlier 方向之间的平衡;\textbf{ii)} 这些尖峰与秩崩溃相吻合,将模型的表达能力集中到狭窄子空间中;\textbf{iii)} 只有解耦变体可防止这一级联效应,保持广泛的谱支持并抑制跨图层的 outlier 形成。这些结果强调,\emph{旋转嵌入的应用方式} 与 \emph{压缩位置} 同样关键。共享旋转分量可减轻谱片段化,保留表示容量。

关键词

引用

@article{arxiv.2507.09394,
  title  = {A Random Matrix Theory Perspective on the Learning Dynamics of Multi-head Latent Attention},
  author = {Nandan Kumar Jha and Brandon Reagen},
  journal= {arXiv preprint arXiv:2507.09394},
  year   = {2025}
}

备注

ICML 2025 Workshop on High-dimensional Learning Dynamics (HiLD)