Tiny Transducer:一种边缘设备上高效的语音识别模型
音频与语音处理
2021-02-09 v2 声音
摘要
本文提出了一种在边缘设备上具有微小解码图的极轻量级基于音素的transducer模型。首先,采用一种基于blank标签跳过的音素同步解码(PSD)算法来加速transducer解码过程。然后,为减少由高blank得分引入的删除错误,提出了一种blank标签去加权方法。为减少参数与计算量,在transducer编码器中使用了深度前馈序列记忆网络(DFSMN)层,并采用了基于CNN的无状态预测器。SVD技术进一步压缩了模型。基于WFST的解码图以上下文无关(CI)音素后验概率作为输入,并允许我们灵活地偏置用户特定信息。最终,在SVD后仅有0.9M参数,我们的系统相比边缘设备上更大的常规混合系统可取得9.1%–20.5%的相对提升。
引用
@article{arxiv.2101.06856,
title = {Tiny Transducer: A Highly-efficient Speech Recognition Model on Edge Devices},
author = {Yuekai Zhang and Sining Sun and Long Ma},
journal= {arXiv preprint arXiv:2101.06856},
year = {2021}
}
备注
Accepted by ICASSP 2021