自动语音识别框架中声学模型参数的量化
音频与语音处理
2020-11-23 v2 声音
摘要
最先进的混合自动语音识别(ASR)系统利用基于深度神经网络(DNN)的声学模型(AM),以 Lattice Free-Maximum Mutual Information(LF-MMI)准则和 n-gram 语言模型训练。AM 通常具有数百万参数,需要显著的参数缩减以在嵌入式设备上运行。本文研究了参数量化对整体词识别性能的影响。给出了以下方法:(i)在 Kaldi 框架中以常规因子化 TDNN(TDNN-F)架构训练的 AM;(ii)在 Kaldi 中构建的 TDNN AM 通过 C++ 封装器加载至 PyTorch 工具包以进行训练后量化;(iii)在 PyTorch 中对 Kaldi TDNN 模型进行量化感知训练;(iv)在 Kaldi 中进行量化感知训练。在标准 Librispeech 设置上获得的结果提供了关于所应用量化方案识别准确率的引人关注的概览。
引用
@article{arxiv.2006.09054,
title = {Quantization of Acoustic Model Parameters in Automatic Speech Recognition Framework},
author = {Amrutha Prasad and Petr Motlicek and Srikanth Madikeri},
journal= {arXiv preprint arXiv:2006.09054},
year = {2020}
}
备注
Submitted to ICASSP21