中文

E-Branchformer:具有增强合并机制的Branchformer用于语音识别

音频与语音处理 2022-10-18 v2 机器学习

摘要

Conformer顺序结合卷积与自注意力以捕获局部与全局信息,展现出卓越性能,目前被视为自动语音识别(ASR)的最先进(state-of-the-art)方法。其他若干研究探索了卷积与自注意力的集成,但未能匹敌Conformer性能。近期提出的Branchformer通过使用专用的卷积与自注意力分支并合并各分支的局部与全局上下文,取得了与Conformer相当的性能。本文中,我们提出E-Branchformer,其通过应用一种有效合并方法并堆叠额外的逐点(point-wise)模块来增强Branchformer。E-Branchformer在LibriSpeech test-clean与test-other集上分别创下1.81%与3.65%的新最先进词错误率(WERs),且未使用任何外部训练数据。

关键词

引用

@article{arxiv.2210.00077,
  title  = {E-Branchformer: Branchformer with Enhanced merging for speech recognition},
  author = {Kwangyoun Kim and Felix Wu and Yifan Peng and Jing Pan and Prashant Sridhar and Kyu J. Han and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2210.00077},
  year   = {2022}
}

备注

Accepted to SLT 2022