基于跨模态干扰消除的野外视觉声源定位
计算机视觉与模式识别
2022-02-15 v1 声音
音频与语音处理
摘要
音视觉声源定位任务在音频干净受限场景下已被充分研究。然而,在真实场景中,音频通常受到屏外声音与背景噪声的污染。它们会干扰识别目标声源与建立视觉-声音关联的过程,使以往研究无法适用。本工作中,我们提出干扰消除器(IEr)框架,解决野外音视觉声源定位问题。其核心思想是通过重新定义与刻画判别性音频表示来消除干扰。具体而言,我们观察到以往仅学习单一音频表示的做法因音频信号的加性本质而不足。因此我们借助音频实例识别模块扩展音频表示,该模块在不同音量音频信号不均匀混合时清晰区分发声实例。随后,我们通过具有跨模态蒸馏的跨模态参照模块,消除可听但屏外声音与静音但可见物体的影响。定量与定性评估表明,所提框架在声源定位任务上取得优越结果,尤其在真实场景中。代码见 https://github.com/alvinliu0/Visual-Sound-Localization-in-the-Wild。
引用
@article{arxiv.2202.06406,
title = {Visual Sound Localization in the Wild by Cross-Modal Interference Erasing},
author = {Xian Liu and Rui Qian and Hang Zhou and Di Hu and Weiyao Lin and Ziwei Liu and Bolei Zhou and Xiaowei Zhou},
journal= {arXiv preprint arXiv:2202.06406},
year = {2022}
}
备注
Accepted by AAAI Conference on Artificial Intelligence (AAAI) 2022. 16 pages