中文

听写并补全缺失字母:用于语音识别的非自回归 Transformer

音频与语音处理 2021-04-27 v2 机器学习 声音 机器学习

摘要

近来,非常深的 transformer 在语音识别中以较大优势超越了传统的双向长短期记忆网络。然而,要将其投入生产使用,推理计算成本在真实场景中仍是一个严重问题。本文中,我们研究两种不同的非自回归 transformer 结构用于自动语音识别(ASR):A-CMLM 和 A-FMLM。在训练期间,对于两种框架,输入给解码器的 token 被随机替换为特殊掩码 token。网络需要同时考虑未掩码的上下文和输入语音来预测那些掩码 token 对应的 token。在推理期间,我们从全部掩码 token 开始,网络基于部分结果迭代预测缺失 token。我们展示了该框架可支持不同的解码策略,包括传统的从左至右。作为一种示例,我们提出了一种新的解码策略,从最容易的预测到最困难的预测。在普通话(Aishell)和日语(CSJ)ASR 基准上的结果表明了训练这样一种用于 ASR 的非自回归网络的可能性。尤其在 Aishell 上,所提方法优于 Kaldi ASR 系统,并以 7 倍加速匹配了最先进的自回归 transformer 的性能。预训练模型和代码将在发表后公开。

关键词

引用

@article{arxiv.1911.04908,
  title  = {Listen and Fill in the Missing Letters: Non-Autoregressive Transformer for Speech Recognition},
  author = {Nanxin Chen and Shinji Watanabe and Jesús Villalba and Najim Dehak},
  journal= {arXiv preprint arXiv:1911.04908},
  year   = {2021}
}