中文

用于混合声音定位的视听分组网络

计算机视觉与模式识别 2023-03-31 v1 机器学习 多媒体

摘要

声源定位是一项典型且具有挑战性的任务,旨在预测视频中声源的位置。以往的单源方法主要利用视听关联作为线索来定位每幅图像中发声的物体。由于原始空间中多声源的混叠特性,除近期一项使用以图像和分离声音为节点的图对比随机游走的工作外,极少有多源方法能同时定位多个声源。尽管它们性能良好,但只能处理固定数量的声源,且无法为各个声源学习紧凑的类别感知表示。为缓解这一不足,本文提出一种新颖的视听分组网络,即 AVGN,它可直接从输入的混合音频和图像中学习每个声源的类别级语义特征,以同时定位多个声源。具体而言,我们的 AVGN 利用可学习的视听类令牌来聚合类别感知的声源特征。然后,每个声源聚合得到的语义特征可作为引导来定位相应的视觉区域。与现有多源方法相比,我们的新框架可定位灵活数量的声源,并为各个声源解耦类别感知的视听表示。我们在 MUSIC、VGGSound-Instruments 和 VGG-Sound Sources 基准上进行了大量实验。结果表明,所提出的 AVGN 在单源和多源场景下均能取得最先进的发声物体定位性能。代码见 \url{https://github.com/stoneMo/AVGN}。

关键词

引用

@article{arxiv.2303.17056,
  title  = {Audio-Visual Grouping Network for Sound Localization from Mixtures},
  author = {Shentong Mo and Yapeng Tian},
  journal= {arXiv preprint arXiv:2303.17056},
  year   = {2023}
}

备注

CVPR 2023