面向语音助手唤醒词检测的语音增强
音频与语音处理
2021-02-01 v1 计算与语言
摘要
关键词 spotting,尤其是唤醒词(Wake-Up-Word, WUW)检测,是语音助手的一项非常重要的任务。语音助手的一个常见问题是,它们容易被背景噪声(如音乐、电视或背景语音)意外触发。在本文中,我们提出了一种适用于WUW检测任务的语音增强(Speech Enhancement, SE)模型,旨在提高识别率并减少在存在此类噪声时的误报。该SE模型是在波形层面的全卷积去噪自编码器,并使用对数梅尔谱图(log-Mel Spectrogram)和波形重建损失,以及一个简单WUW分类网络的BCE损失进行训练。我们专门构建了一个新的数据库用于挑战性条件下识别WUW的任务,其中包含与关键词音素高度相似的负样本。该数据库通过公共数据库和详尽的数据增强进行扩展,以模拟不同的噪声和环境。将SE与简单及最先进的WUW检测器级联所得的结果表明,在安静环境中SE不会对识别率产生负面影响,同时在存在噪声时提升了性能,尤其在SE与WUW检测器端到端联合训练时。
引用
@article{arxiv.2101.12732,
title = {Speech Enhancement for Wake-Up-Word detection in Voice Assistants},
author = {David Bonet and Guillermo Cámbara and Fernando López and Pablo Gómez and Carlos Segura and Jordi Luque},
journal= {arXiv preprint arXiv:2101.12732},
year = {2021}
}
备注
keyword spotting, speech enhancement, wake-up-word, deep learning, convolutional neural network