中文

BaldWhisper:基于头层削减与层合并的更快 Whisper

音频与语音处理 2026-05-05 v2 人工智能 计算与语言 声音

摘要

在数据稀缺的场景中,对大规模预训练变换器进行剪枝具有挑战性,因为这通常需要大量 retraining 数据来恢复性能。例如,Distill-Whisper 通过 40% 剪枝并在 21000 小时语音数据上重新训练,远超大多数语言可用数据的范围。如何在数据稀缺的边缘设备上让 Whisper 更轻快和高效?本文聚焦于仅拥有 32 小时语音识别数据的巴马巴拉语,提出一种新型剪枝方案。我们不进行词表剪枝,因为巴马巴拉语使用者常进行语种混合,导致该方案不适用。相反,我们采用低秩分解和特征蒸馏压缩嵌入层。而非删除层,我们选择合并层以限制性能损失。最终模型在保留原性能 90% 的同时,体积缩小 48%,在 MacBook Air M1 上实现 2.15 倍加速。

关键词

引用

@article{arxiv.2510.08599,
  title  = {BaldWhisper: Faster Whisper with Head Shearing and Layer Merging},
  author = {Yaya Sy and Christophe Cerisara and Irina Illina},
  journal= {arXiv preprint arXiv:2510.08599},
  year   = {2026}
}