中文

USM-Lite:面向通用语音模型语音识别的量化与稀疏感知微调

音频与语音处理 2024-01-17 v3 声音

摘要

随着近期大规模通用语音模型(USM)的发展,端到端自动语音识别(ASR)模型的质量获得了革命性的提升。然而,由于巨大的内存使用量和计算成本,部署这些庞大的USM极其昂贵。因此,模型压缩是在实际场景中将基于USM的ASR纳入预算的重要研究课题。在本研究中,我们提出了一种面向ASR的USM微调方法,在模型权重上采用低比特量化和N:M结构化稀疏感知范式,从参数精度和矩阵拓扑的角度降低模型复杂度。我们在大规模语音搜索数据集上使用20亿参数的USM进行了广泛实验,以评估我们提出的方法。一系列消融研究验证了高达int4量化和2:4稀疏性的有效性。然而,在包括int2量化和1:4稀疏性的极端设置下,单一压缩技术无法很好地恢复性能。相比之下,我们提出的方法可以将模型压缩至原大小的9.4%,代价仅为7.3%的相对词错误率(WER)退化。我们还对结果提供了深入分析,并讨论了局限性和潜在解决方案,这对未来的研究将具有价值。

关键词

引用

@article{arxiv.2312.08553,
  title  = {USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models},
  author = {Shaojin Ding and David Qiu and David Rim and Yanzhang He and Oleg Rybakov and Bo Li and Rohit Prabhavalkar and Weiran Wang and Tara N. Sainath and Zhonglin Han and Jian Li and Amir Yazdanbakhsh and Shivani Agrawal},
  journal= {arXiv preprint arXiv:2312.08553},
  year   = {2024}
}

备注

Accepted by ICASSP 2024. Preprint