中文

用于多通道语音识别的基于注意力的神经波束形成层

音频与语音处理 2021-05-18 v2 机器学习 声音

摘要

基于注意力的波束形成器近来被证明对多通道语音识别有效。然而,它们捕捉局部信息的能力较弱。在本工作中,我们提出一种将卷积神经网络与注意力相结合的二维卷积-注意力(2D Conv-Attention)模块用于波束形成。我们应用自注意力与交叉注意力来显式建模输入通道内部及通道之间的相关性。端到端二维卷积-注意力模型与多头自注意力及基于超指向性的神经波束形成器进行了比较。我们在内部多通道数据集上训练并评估。结果表明,相较基线神经波束形成器,所提模型的词错率(WER)相对降低 3.8%。

关键词

引用

@article{arxiv.2105.05920,
  title  = {Attention-based Neural Beamforming Layers for Multi-channel Speech Recognition},
  author = {Bhargav Pulugundla and Yang Gao and Brian King and Gokce Keskin and Harish Mallidi and Minhua Wu and Jasha Droppo and Roland Maas},
  journal= {arXiv preprint arXiv:2105.05920},
  year   = {2021}
}