归纳网络:用于自监督声源定位的视听模态鸿沟桥接
计算机视觉与模式识别
2023-08-10 v1 人工智能
多媒体
声音
音频与语音处理
摘要
自监督声源定位通常受模态不一致问题困扰。在近期研究中,基于对比学习的策略展现出良好前景,可在视觉场景中建立音频与声源间的一致对应。遗憾的是,对不同模态特征中异质性影响的关注不足,仍制约该方案进一步提升,这也成为本工作的动机。本研究提出一种归纳网络(Induction Network)以更有效地桥接模态鸿沟。通过解耦视觉与音频模态的梯度,所设计的归纳向量(Induction Vector)以自举方式学习声源的判别性视觉表征,并令音频模态与视觉模态保持一致对齐。除视觉加权对比损失外,引入自适应阈值选择策略以增强归纳网络的鲁棒性。在 SoundNet-Flickr 与 VGG-Sound Source 数据集上的大量实验表明,其在不同挑战性场景中优于其他 SOTA 工作。代码见 https://github.com/Tahy1/AVIN
引用
@article{arxiv.2308.04767,
title = {Induction Network: Audio-Visual Modality Gap-Bridging for Self-Supervised Sound Source Localization},
author = {Tianyu Liu and Peng Zhang and Wei Huang and Yufei Zha and Tao You and Yanning Zhang},
journal= {arXiv preprint arXiv:2308.04767},
year = {2023}
}
备注
Accepted to ACM Multimedia 2023