中文

通过个性化增强量化端到端 ASR 模型

声音 2023-09-19 v1 人工智能 音频与语音处理

摘要

近期端到端自动语音识别(ASR)模型变得日益庞大,使其在资源受限设备上的部署尤为困难。模型量化是一种有效解决方案,但有时会导致词错率(WER)上升。本文提出一种针对量化模型的个性化(PQM)新策略,其将说话人自适应训练(SAT)与模型量化相结合,以改善重度压缩模型的性能。具体而言,PQM 使用 4-bit NormalFloat 量化(NF4)方法进行模型量化,并使用低秩自适应(LoRA)进行 SAT。实验在 LibriSpeech 和 TED-LIUM 3 语料库上进行。值得注意的是,在模型尺寸缩减 7 倍且增加 1% 说话人特定参数的情况下,相较于原始全精度模型,量化后的 Whisper 和基于 Conformer 的注意力编码器-解码器 ASR 模型分别实现了 15.1% 和 23.3% 的相对 WER 降低。

关键词

引用

@article{arxiv.2309.09136,
  title  = {Enhancing Quantised End-to-End ASR Models via Personalisation},
  author = {Qiuming Zhao and Guangzhi Sun and Chao Zhang and Mingxing Xu and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:2309.09136},
  year   = {2023}
}

备注

5 pages, submitted to ICASSP 2024