利用块增强 Transformer 改进普通话语音识别
计算与语言
2022-12-02 v5 声音
音频与语音处理
摘要
近来,卷积增强 Transformer(Conformer)在自动语音识别(ASR)中展现出有前景的结果,优于先前最佳的已发表 Transformer Transducer。在本工作中,我们认为编码器与解码器中每个块的输出信息并非完全包容,换言之,它们的输出信息可能是互补的。我们研究如何以参数高效的方式利用每个块的互补信息,并期望这能带来更鲁棒的性能。因此我们提出了用于语音识别的块增强 Transformer,称为 Blockformer。我们实现了两种块集成方法:块输出加权和(Base-WSBO)基础法,以及挤压激励模块加权和块输出(SE-WSBO)。实验证明,Blockformer 在 AISHELL-1 上显著优于最先进的基于 Conformer 的模型,我们的模型在测试集上不使用语言模型时字错率(CER)达到 4.29%,使用外部语言模型时达到 4.05%。
引用
@article{arxiv.2207.11697,
title = {Improving Mandarin Speech Recogntion with Block-augmented Transformer},
author = {Xiaoming Ren and Huifeng Zhu and Liuwei Wei and Minghui Wu and Jie Hao},
journal= {arXiv preprint arXiv:2207.11697},
year = {2022}
}