中文

用于语音识别的多通道Transformer转导器

音频与语音处理 2021-08-31 v1 机器学习 声音

摘要

相比单通道,多通道输入具有若干优势,可提升端侧语音识别系统的鲁棒性。近期关于多通道transformer的工作提出了一种将此类输入引入端到端ASR以提高准确率的方法。然而,该方法计算复杂度高,阻碍了其部署于端侧系统。本文提出一种新颖的语音识别模型——多通道Transformer转导器(Multi-Channel Transformer Transducer, MCTT),其具备端到端多通道训练、低计算成本和低延迟的特点,因此适用于端侧语音识别中的流式解码。在一个远场内部数据集上,我们的MCTT相比采用transformer-transducer的级联多通道模型取得了最高6.01%的相对词错率提升(WERR)。此外,MCTT相比多通道transformer取得了最高11.62%的WERR,且推理速度提升15.8倍。我们进一步表明,可通过约束注意力计算中的未来与历史上下文来改进MCTT的计算成本。

关键词

引用

@article{arxiv.2108.12953,
  title  = {Multi-Channel Transformer Transducer for Speech Recognition},
  author = {Feng-Ju Chang and Martin Radfar and Athanasios Mouchtaris and Maurizio Omologo},
  journal= {arXiv preprint arXiv:2108.12953},
  year   = {2021}
}