多尺度多实例视觉声源定位与分割
计算机视觉与模式识别
2024-09-04 v1 机器学习
多媒体
声音
音频与语音处理
摘要
视觉声源定位是一个典型且具有挑战性的问题,它预测视频中与声源对应的物体的位置。先前的方法主要使用全局音频和单一尺度视觉特征之间的视听关联来定位每张图像中的发声物体。尽管它们表现出有前景的性能,但它们忽略了相应图像的多尺度视觉特征,并且与真实值相比,它们无法学习到具有判别性的区域。为了解决这个问题,我们提出了一种新颖的多尺度多实例视觉声源定位框架,即M2VSL,它可以直接从输入图像中学习与声源相关的多尺度语义特征来定位发声物体。具体来说,我们的M2VSL利用可学习的多尺度视觉特征,在相应图像的多级位置对齐视听表示。我们还引入了一种新颖的多尺度多实例Transformer,用于动态聚合多尺度跨模态表示以进行视觉声源定位。我们在VGGSound-Instruments、VGG-Sound Sources和AVSBench基准上进行了广泛的实验。结果表明,所提出的M2VSL在发声物体定位和分割上均能达到最先进的性能。
引用
@article{arxiv.2409.00486,
title = {Multi-scale Multi-instance Visual Sound Localization and Segmentation},
author = {Shentong Mo and Haofan Wang},
journal= {arXiv preprint arXiv:2409.00486},
year = {2024}
}