中文

端到端多波束关键词 spotting

音频与语音处理 2020-05-22 v1 声音

摘要

关键词 spotting(KWS)的性能以误报和漏报衡量,在远场和噪声条件下会显著下降。在本文中,我们提出一种用于语音增强的多波束神经网络建模,其同时转向监听多个采样的波束方向。该多波束增强随后与 KWS 联合训练,形成一个端到端 KWS 模型,该模型整合来自多个波束方向的增强信号,并利用注意力机制动态调谐模型对可靠声源的注意。我们在大规模噪声和远场评估集上证明,相较于基线 KWS 系统和近期基于波束形成器的多波束 KWS 系统,所提方法显著改善了 KWS 性能。

关键词

引用

@article{arxiv.2005.10386,
  title  = {End-to-End Multi-Look Keyword Spotting},
  author = {Meng Yu and Xuan Ji and Bo Wu and Dan Su and Dong Yu},
  journal= {arXiv preprint arXiv:2005.10386},
  year   = {2020}
}

备注

Submitted to Interspeech2020