DKU 用于 2021 MISP 挑战赛的音频-视觉唤醒词检测赛后系统:深度分析
声音
2023-03-07 v1 音频与语音处理
摘要
本文进一步探讨了我们在 MISP Challenge 2021 Track 1 中排名第二的先前唤醒词检测系统。首先,我们研究了一种基于 3D 和 2D 卷积的鲁棒单模态方法,并采用简单注意力模块(SimAM)以提升系统性能。其次,我们探索了不同数据增强方法的组合以获得更好性能。最后,我们研究了融合策略,包括分数级、级联和神经网络融合。我们提出的多模态系统利用多模态特征,并使用互补的视觉信息来缓解纯音频系统在复杂声学场景中的性能下降。我们的系统在竞赛数据库评测集上获得了 2.15% 的误拒率和 3.44% 的误报率,相比先前系统取得了 21% 的相对提升,达到了新的 SOTA 性能。
引用
@article{arxiv.2303.02348,
title = {The DKU Post-Challenge Audio-Visual Wake Word Spotting System for the 2021 MISP Challenge: Deep Analysis},
author = {Haoxu Wang and Ming Cheng and Qiang Fu and Ming Li},
journal= {arXiv preprint arXiv:2303.02348},
year = {2023}
}
备注
Accepted by ICASSP 2023