Whisper-MLA:基于 MHA2MLA 转换降低 ASR 模型 GPU 内存消耗
声音
2026-03-03 v1 人工智能
摘要
基于 Transformer 的 Whisper 模型在自动语音识别(ASR)中取得了领先的性能。然而,其多头注意力(MHA)机制导致 GPU 内存消耗显著增加,原因是键值(KV)缓存使用随序列长度线性增长,这在处理长音频时尤为问题。为解决此问题,本文引入 Whisper-MLA,这是一种新型架构,将多头潜在注意力(MLA)引入 Whisper 模型。具体而言,我们为 Whisper 的绝对位置嵌入调整了 MLA,并系统地研究了其在编码器自注意力、解码器自注意力和跨注意力模块中的应用。实验结果表明,仅将 MLA 应用于解码器自注意力即可在性能和内存效率之间取得理想的平衡。我们的方法允许对预训练的 Whisper 模型进行最小化的微调即可转换为 Whisper-MLA。在 LibriSpeech 基准上的大量实验验证了这种转换的有效性,证明 Whisper-MLA 在保持竞争准确率的同时,可将 KV 缓存大小降低最高 87.5%。
引用
@article{arxiv.2603.00563,
title = {Whisper-MLA: Reducing GPU Memory Consumption of ASR Models based on MHA2MLA Conversion},
author = {Sen Zhang and Jianguo Wei and Wenhuan Lu and Xianghu Yue and Wei Li and Qiang Li and Pengcheng Zhao and Ming Cai and Luo Si},
journal= {arXiv preprint arXiv:2603.00563},
year = {2026}
}
备注
5 pages, 3 figures, accepted at ICASSP 2026