Tucker 注意力:一种对近似注意力机制的泛化
机器学习
2026-04-01 v1 人工智能
摘要
追求降低多头自注意力(MHA)中自注意力机制内存占用的目标,催生了一系列方法,例如组查询注意力(GQA)和多头潜在注意力(MLA)。这些方法利用特定的低秩分解应用于嵌入维度或注意力头之间。从经典低秩逼近的视角看,这些方法比较非传统,引发疑问:它们实际上近似了什么对象,如何解释其结果表示的低秩行为。为回答这些问题,本文提出了一种关于自注意力层中权重对象的泛化视图和一种分解策略,使我们能够构建一种参数高效的方案,称为 Tucker 注意力。相较于 GQA 和 MLA,Tucker 注意力在可比较的验证指标下所需的参数数量只有它们的十分之一,经 LLM 和 ViT 测试案例评估。此外,Tucker 注意力包含 GQA、MLA、MHA 作为特殊情况,且完全兼容 flash-attention 和旋转位置编码(RoPE)。这种泛化策略揭示了 MHA、GQA 和 MLA 实际实现的秩,并进一步使 MLA 能够简化。
引用
@article{arxiv.2603.30033,
title = {Tucker Attention: A generalization of approximate attention mechanisms},
author = {Timon Klein and Jonas Kusch and Sebastian Sager and Stefan Schnake and Steffen Schotthöfer},
journal= {arXiv preprint arXiv:2603.30033},
year = {2026}
}