一种用于动态模型尺寸的统一级联编码器ASR模型
音频与语音处理
2022-06-28 v3 机器学习
声音
摘要
本文提出一种动态级联编码器自动语音识别(ASR)模型,该模型统一了面向不同部署场景的模型。此外,该模型能在不损失质量的前提下显著减小模型尺寸和功耗。具体而言,利用动态级联编码器模型,我们探索了三种技术以最大程度提升各模型尺寸下的性能:1)各子模型使用独立解码器而共享编码器;2)使用漏斗池化(funnel-pooling)提升编码器效率;3)平衡因果与非因果编码器的尺寸以改善质量并满足部署约束。总体而言,相较于基线级联编码器模型,所提出的大-中模型尺寸减小30%且功耗降低33%。统一大、中、小模型的三尺寸模型在质量损失极小的情况下实现了37%的总尺寸缩减,同时大幅减少了维护独立模型所需的工程工作量。
引用
@article{arxiv.2204.06164,
title = {A Unified Cascaded Encoder ASR Model for Dynamic Model Sizes},
author = {Shaojin Ding and Weiran Wang and Ding Zhao and Tara N. Sainath and Yanzhang He and Robert David and Rami Botros and Xin Wang and Rina Panigrahy and Qiao Liang and Dongseong Hwang and Ian McGraw and Rohit Prabhavalkar and Trevor Strohman},
journal= {arXiv preprint arXiv:2204.06164},
year = {2022}
}
备注
Accepted by INTERSPEECH 2022