中文

通过消除假阴性增强声源定位

计算机视觉与模式识别 2024-08-30 v1

摘要

声源定位旨在定位发出声音的物体。近期工作通常依赖对比学习,取得令人印象深刻的结果。然而,先前方法中随机采样负样本的常规做法可能导致假阴性问题,即声音在语义上与视觉实例相似的样本被采样为负样本并被错误地推远。这种视觉特征与音频特征的错位可能导致性能下降。为解决此问题,我们提出了一种新型音视频学习框架,包含两个独立学习方案:自监督预测学习(SSPL)和语义感知对比学习(SACL)。SSPL仅探索图像-音频正样本对,以发现音视频特征之间的语义一致性,同时引入预测编码模块进行特征对齐,以促进仅基于正样本的学习。就此而言,SSPL是一种无负样本的方法,用于消除假阴性。相比之下,SACL旨在紧凑视觉特征并消除假阴性,为对比学习提供可靠的视觉锚点和音频负样本。与SSPL不同,SACL释放了音视频对比学习的潜力,为实现相同目标提供了有效替代方案。全面实验表明,我们的方法优于当前最先进的方法。此外,我们突出了所学表示的多样性,通过扩展到音视频事件分类和目标检测任务进行验证。代码和模型已提供:https://github.com/zjsong/SACL。

关键词

引用

@article{arxiv.2408.16448,
  title  = {Enhancing Sound Source Localization via False Negative Elimination},
  author = {Zengjie Song and Jiangshe Zhang and Yuxi Wang and Junsong Fan and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2408.16448},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2203.13412