中文

基于帧级跨模态注意力的音视频 Conformer 的鲁棒唤醒词检测

声音 2024-03-05 v1 多媒体 音频与语音处理

摘要

近年来,基于神经网络的唤醒词检测在干净音频样本上取得了良好性能,但在嘈杂环境中表现不佳。音视频唤醒词检测(AVWWS)受到广泛关注,因为视觉唇部运动信息不受复杂声学场景的影响。以往的工作通常使用简单的加法或拼接进行多模态融合。模态间的相关性仍然相对未被充分探索。在本文中,我们提出了一种称为帧级跨模态注意力(FLCMA)的新型模块,以提高 AVWWS 系统的性能。该模块可以通过同步的唇部运动和语音信号在帧级帮助建模多模态信息。我们训练了基于 FLCMA 的端到端音视频 Conformer,并通过微调预训练的单模态模型进一步提高了 AVWWS 任务的性能。所提出的系统在远场 MISP 数据集上取得了新的最先进结果(4.57% WWS 分数)。

关键词

引用

@article{arxiv.2403.01700,
  title  = {Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer},
  author = {Haoxu Wang and Ming Cheng and Qiang Fu and Ming Li},
  journal= {arXiv preprint arXiv:2403.01700},
  year   = {2024}
}

备注

Accepted by ICASSP 2024