端到端多波束关键词 spotting
音频与语音处理
2020-05-22 v1 声音
摘要
关键词 spotting(KWS)的性能以误报和漏报衡量,在远场和噪声条件下会显著下降。在本文中,我们提出一种用于语音增强的多波束神经网络建模,其同时转向监听多个采样的波束方向。该多波束增强随后与 KWS 联合训练,形成一个端到端 KWS 模型,该模型整合来自多个波束方向的增强信号,并利用注意力机制动态调谐模型对可靠声源的注意。我们在大规模噪声和远场评估集上证明,相较于基线 KWS 系统和近期基于波束形成器的多波束 KWS 系统,所提方法显著改善了 KWS 性能。
引用
@article{arxiv.2005.10386,
title = {End-to-End Multi-Look Keyword Spotting},
author = {Meng Yu and Xuan Ji and Bo Wu and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:2005.10386},
year = {2020}
}
备注
Submitted to Interspeech2020