通过个性化增强量化端到端 ASR 模型
声音
2023-09-19 v1 人工智能
音频与语音处理
摘要
近期端到端自动语音识别(ASR)模型变得日益庞大,使其在资源受限设备上的部署尤为困难。模型量化是一种有效解决方案,但有时会导致词错率(WER)上升。本文提出一种针对量化模型的个性化(PQM)新策略,其将说话人自适应训练(SAT)与模型量化相结合,以改善重度压缩模型的性能。具体而言,PQM 使用 4-bit NormalFloat 量化(NF4)方法进行模型量化,并使用低秩自适应(LoRA)进行 SAT。实验在 LibriSpeech 和 TED-LIUM 3 语料库上进行。值得注意的是,在模型尺寸缩减 7 倍且增加 1% 说话人特定参数的情况下,相较于原始全精度模型,量化后的 Whisper 和基于 Conformer 的注意力编码器-解码器 ASR 模型分别实现了 15.1% 和 23.3% 的相对 WER 降低。
引用
@article{arxiv.2309.09136,
title = {Enhancing Quantised End-to-End ASR Models via Personalisation},
author = {Qiuming Zhao and Guangzhi Sun and Chao Zhang and Mingxing Xu and Thomas Fang Zheng},
journal= {arXiv preprint arXiv:2309.09136},
year = {2023}
}
备注
5 pages, submitted to ICASSP 2024