无需先验声源知识的混合声源视觉定位学习
计算机视觉与模式识别
2024-04-04 v1 多媒体
声音
音频与语音处理
摘要
多声源定位任务的目标是从混合声中单独定位每个声源。尽管近期多声源定位方法已展现出性能提升,但它们因依赖关于待分离对象数量的先验信息而面临挑战。在本文中,为克服这一局限,我们提出了一种新颖的多声源定位方法,无需声源数量的先验知识即可进行定位。为实现这一目标,我们提出了一个迭代对象识别(IOI)模块,能够以迭代方式识别发声物体。在找到发声物体区域后,我们设计了对象相似性感知聚类(OSC)损失,以引导IOI模块有效合并同一物体的区域,同时区分不同物体与背景。这使得我们的方法能够在没有任何先验知识的情况下对发声物体进行准确定位。在MUSIC和VGGSound基准上的大量实验结果表明,所提方法在单声源和多声源场景下均显著优于现有方法。我们的代码可在以下链接获取:https://github.com/VisualAIKHU/NoPrior_MultiSSL
引用
@article{arxiv.2403.17420,
title = {Learning to Visually Localize Sound Sources from Mixtures without Prior Source Knowledge},
author = {Dongjin Kim and Sung Jin Um and Sangmin Lee and Jung Uk Kim},
journal= {arXiv preprint arXiv:2403.17420},
year = {2024}
}
备注
Accepted at CVPR 2024