级联 RNN-Transducer:基于音节的流式端侧中文语音识别及音节到汉字转换器
声音
2020-11-18 v1 计算与语言
音频与语音处理
摘要
端到端模型因其简化的系统结构和优越的性能而在自动语音识别(ASR)中受到青睐。在这些模型中,循环神经网络转导器(RNN-T)因高精度和低延迟在流式端侧语音识别中取得了显著进展。RNN-T 采用预测网络来增强语言信息,但其语言建模能力有限,因为它仍需要配对的语音-文本数据进行训练。通过额外文本数据(例如与外部语言模型进行浅融合)进一步增强语言建模能力仅带来微小的性能提升。鉴于中文是基于字符的语言且每个字符发音为一个带调音节,本文提出一种新颖的级联 RNN-T 方法来改善 RNN-T 的语言建模能力。我们的方法首先使用 RNN-T 将声学特征转换为音节序列,然后通过基于 RNN-T 的音节到汉字转换器将音节序列转换为字符序列。因此,丰富的文本库可轻易用于增强语言模型能力。通过引入若干重要技巧,级联 RNN-T 方法在多个中文测试集上大幅超越基于字符的 RNN-T,具有更高的识别质量和相似的延迟。
引用
@article{arxiv.2011.08469,
title = {Cascade RNN-Transducer: Syllable Based Streaming On-device Mandarin Speech Recognition with a Syllable-to-Character Converter},
author = {Xiong Wang and Zhuoyuan Yao and Xian Shi and Lei Xie},
journal= {arXiv preprint arXiv:2011.08469},
year = {2020}
}
备注
7 pages, 3 figures, 5 tables