VE-KWS:视觉模态增强的端到端关键词 spotting
声音
2023-03-15 v2 音频与语音处理
摘要
基于音频模态的关键词 spotting(KWS)系统的性能(通常以误报和漏报衡量)在远场和噪声条件下会显著下降。因此,利用多模态间互补关系的音视频关键词 spotting 近期受到广泛关注。然而,现有研究主要集中于组合不同模态各自独立学习到的表示,而非在各自建模过程中探索模态间关系。本文提出一种新颖的视觉模态增强端到端 KWS 框架(VE-KWS),从两方面融合音频与视觉模态。其一是利用视频中唇部区域获得的说话人位置信息辅助多通道音频波束成形器的训练;通过将波束成形器作为音频增强模块,可显著抑制由远场或噪声环境引起的声学失真。其二是进行跨模态注意力以捕捉模态间关系并辅助各模态的表示学习。在 MSIP challenge 语料上的实验表明,我们所提模型在 Eval 集上取得了 2.79% 的漏报率和 2.95% 的误报率,相较 ICASSP2022 MISP challenge 中排名靠前的系统实现了新的 SOTA 性能。
引用
@article{arxiv.2302.13523,
title = {VE-KWS: Visual Modality Enhanced End-to-End Keyword Spotting},
author = {Ao Zhang and He Wang and Pengcheng Guo and Yihui Fu and Lei Xie and Yingying Gao and Shilei Zhang and Junlan Feng},
journal= {arXiv preprint arXiv:2302.13523},
year = {2023}
}
备注
5 pages. Accepted at ICASSP2023