中文

用于端到端多通道远场语音识别的自注意力通道组合器前端

声音 2021-09-13 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

当提供足够大的远场训练数据时,联合优化多通道前端和端到端(E2E)自动语音识别(ASR)后端显示出良好的效果。近期文献表明,传统的波束形成器设计(如MVDR(最小方差无失真响应)或固定波束形成器)可以作为具有可学习参数的前端成功集成到E2E ASR系统中。在这项工作中,我们提出了自注意力通道组合器(SACC)ASR前端,它利用自注意力机制在幅度谱域中结合多通道音频信号。在多通道播放测试数据上进行的实验表明,与基于最先进固定波束形成器的前端相比,SACC实现了9.3%的WERR,两者均与基于ContextNet的ASR后端进行了联合优化。我们还展示了SACC与传统波束形成器之间的联系,并分析了SACC的中间输出。

关键词

引用

@article{arxiv.2109.04783,
  title  = {Self-Attention Channel Combinator Frontend for End-to-End Multichannel Far-field Speech Recognition},
  author = {Rong Gong and Carl Quillen and Dushyant Sharma and Andrew Goderre and José Laínez and Ljubomir Milanović},
  journal= {arXiv preprint arXiv:2109.04783},
  year   = {2021}
}

备注

In Proceedings of Interspeech 2021