BaldWhisper:基于头层削减与层合并的更快 Whisper
音频与语音处理
2026-05-05 v2 人工智能
计算与语言
声音
摘要
在数据稀缺的场景中,对大规模预训练变换器进行剪枝具有挑战性,因为这通常需要大量 retraining 数据来恢复性能。例如,Distill-Whisper 通过 40% 剪枝并在 21000 小时语音数据上重新训练,远超大多数语言可用数据的范围。如何在数据稀缺的边缘设备上让 Whisper 更轻快和高效?本文聚焦于仅拥有 32 小时语音识别数据的巴马巴拉语,提出一种新型剪枝方案。我们不进行词表剪枝,因为巴马巴拉语使用者常进行语种混合,导致该方案不适用。相反,我们采用低秩分解和特征蒸馏压缩嵌入层。而非删除层,我们选择合并层以限制性能损失。最终模型在保留原性能 90% 的同时,体积缩小 48%,在 MacBook Air M1 上实现 2.15 倍加速。
引用
@article{arxiv.2510.08599,
title = {BaldWhisper: Faster Whisper with Head Shearing and Layer Merging},
author = {Yaya Sy and Christophe Cerisara and Irina Illina},
journal= {arXiv preprint arXiv:2510.08599},
year = {2026}
}