多通道关键词 spotting 中具有听觉注意力的端到端模型
声音
2018-11-06 v2 音频与语音处理
摘要
本文提出一种基于注意力的端到端模型用于多通道关键词 spotting (KWS),该模型被训练以直接优化 KWS 结果。因此,我们的模型在干净和噪声测试数据上均优于采用信号预处理技术的基线模型。我们还发现,当训练与测试数据相似时,多任务学习能带来更好的性能。迁移学习和多目标谱映射可显著增强对噪声环境的鲁棒性。在每小时 0.1 次误报 (FA) 下,具有迁移学习和多目标映射的模型在 SNR 约 -20 的噪声数据中唤醒率获得了绝对的 30% 提升。
引用
@article{arxiv.1811.00350,
title = {End-to-end Models with auditory attention in Multi-channel Keyword Spotting},
author = {Haitong Zhang and Junbo Zhang and Yujun Wang},
journal= {arXiv preprint arXiv:1811.00350},
year = {2018}
}
备注
Submitted to ICASSP 2019