中文

面向内存与计算效率的 Whisper 模型结构化稀疏与自适应剪枝

机器学习 2025-10-15 v1

摘要

Whisper 模型在语音识别方面取得了显著进展,但其庞大的数据集大小仍是部署到资源受限边缘设备上的瓶颈。本文提出了一个框架,用于设计针对上述问题的 Whisper 模型变体。通过稀疏组 LASSO 正则化强制实现结构化稀疏,以减少浮点运算次数(FLOPs)。进一步提出了一种基于权重统计信息的剪枝算法。我们还设计了用于 WER 评估的自定义文本规范化器。在 Common Voice 11.0 印地语数据集上,在不降低 WER 的情况下,我们实现了:(a) 在 Whisper-small 上,模型参数减少 35.4%,内存消耗降低 14.25%,FLOPs 减少 18.5%;(b) 在 Whisper-medium 上,模型参数减少 31%,内存消耗降低 15.29%,FLOPs 减少 16.95%;(c) 在剪枝 18.7% 更多参数的同时,显著优于基于迭代大小剪枝(Iterative Magnitude Pruning)的基于 SOTA 方法,WER 降低 12.31。

关键词

引用

@article{arxiv.2510.12666,
  title  = {Structured Sparsity and Weight-adaptive Pruning for Memory and Compute efficient Whisper models},
  author = {Prasenjit K Mudi and Anshi Sachan and Dahlia Devapriya and Sheetal Kalyani},
  journal= {arXiv preprint arXiv:2510.12666},
  year   = {2025}
}