中文

量化端到端语音识别模型的说话人适应

声音 2024-08-09 v1 音频与语音处理

摘要

端到端模型在自动语音识别 (ASR) 中表现优异。然而,这些模型通常体积很大,难以部署在资源受限的边缘设备上。虽然量化可以减小模型大小,但会导致词错误率 (WER) 上升。虽然提出了改进的量化方法来解决性能下降问题,但量化模型部署在边缘设备上时往往只针对少数用户群体,这一事实仍未得到充分探讨。为此,我们提出了一种针对量化端到端 ASR 模型的个人化策略(P4Q),该策略使用说话人适应 (SA) 通过拟合目标说话人的特征来提高量化端到端 ASR 模型的性能。本文基于 Whisper 和 Conformer 基于注意力的编码器-解码器 (AED) 端到端 ASR 模型研究 P4Q 策略,该策略采用 4 位块状 NormalFloat4 (NF4) 方法进行量化,并使用低秩适应 (LoRA) 方法进行 SA。在 LibriSpeech 和 TED-LIUM 3 语料库上的实验结果表明,相较于全精度模型,P4Q 在量化 Whisper 和 Conformer AED 模型上分别实现了约 7 倍的模型大小缩减和 1% 的额外说话人特定参数,实现了约 15.1% 和 23.3% 的相对 WER 降低。

关键词

引用

@article{arxiv.2408.03979,
  title  = {Speaker Adaptation for Quantised End-to-End ASR Models},
  author = {Qiuming Zhao and Guangzhi Sun and Chao Zhang and Mingxing Xu and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:2408.03979},
  year   = {2024}
}

备注

submitted to ASRU 2023 Workshop