中文

T-VSL:混合场景中文本引导的视觉声源定位

计算机视觉与模式识别 2024-07-09 v2 声音 音频与语音处理

摘要

视觉声源定位在识别视频中每个发声源的语义区域方面面临重大挑战。现有的自监督和弱监督源定位方法难以准确区分每个发声对象的语义区域,尤其是在多源混合场景中。这些方法通常依赖音视频对应关系作为指导,在复杂的多源定位场景中会导致性能大幅下降。训练过程中无法获取多源混合中的单个源声音,加剧了学习有效音视频对应关系进行定位的困难。为解决这一局限,本文提出利用三模态联合嵌入模型(如AudioCLIP)将文本模态作为中间特征引导,以解耦多源混合中的语义音视频源对应关系。我们的框架T-VSL首先预测混合中发声实体的类别,随后利用每个发声源的文本表示作为引导,借助三模态AudioCLIP嵌入从多源混合中解耦细粒度的音视频源对应关系。该方法使框架能够处理灵活数量的源,并在测试时展现出对未见类别的有前景的零样本迁移能力。在MUSIC、VGGSound和VGGSound-Instruments数据集上的大量实验表明,该方法在性能上显著优于现有最先进方法。代码已发布在https://github.com/enyac-group/T-VSL/tree/main。

关键词

引用

@article{arxiv.2404.01751,
  title  = {T-VSL: Text-Guided Visual Sound Source Localization in Mixtures},
  author = {Tanvir Mahmud and Yapeng Tian and Diana Marculescu},
  journal= {arXiv preprint arXiv:2404.01751},
  year   = {2024}
}

备注

Accepted in CVPR-2024. Code: https://github.com/enyac-group/T-VSL/tree/main