DCCRN-KWS:一种基于音频偏置的噪声鲁棒小资源关键词 spotting 模型
音频与语音处理
2023-06-14 v3 声音
摘要
真实世界复杂声学环境,尤其是低信噪比(SNR)环境,会给关键词 spotting(KWS)系统带来巨大挑战。受神经语音增强与语音识别中上下文偏置近期进展的启发,我们提出一种鲁棒的基于音频上下文偏置的 DCCRN-KWS 模型以应对该挑战。我们将整体架构构建为去噪与关键词 spotting 的多任务学习框架,其中 DCCRN 编码器与 KWS 模型相连。借助去噪任务,我们进一步引入音频上下文偏置模块,以利用真实关键词样本并偏置网络从而在噪声条件下更好地区分关键词。我们还引入了特征融合与复上下文线性模块,分别增强该区分能力并有效利用上下文信息。在内部挑战性数据集与 HIMIYA 公开数据集上的实验表明,我们的 DCCRN-KWS 系统性能更优,而消融研究证明了整体模型的良好设计。
引用
@article{arxiv.2305.12331,
title = {DCCRN-KWS: an audio bias based model for noise robust small-footprint keyword spotting},
author = {Shubo Lv and Xiong Wang and Sining Sun and Long Ma and Lei Xie},
journal= {arXiv preprint arXiv:2305.12331},
year = {2023}
}
备注
Accepted by INTERSPEECH2023