从沉默与噪声中学习:视觉声源定位
计算机视觉与模式识别
2025-09-01 v1 多媒体
摘要
视觉声源定位是旨在给定视频音频检测声源位置的基本感知任务。尽管近期取得了进展,但我们发现当前方法存在两个不足:1)大多数方法在声音-视觉语义对应性较差的情况下表现不佳,例如沉默、噪声和离屏声音,即存在负声音;2)大多数先前的评估仅限于正面案例,即数据集和指标仅传递场景中单个可见声源。为此,我们提出了三个关键贡献。首先,我们提出了一种新的训练策略,纳入沉默和噪声,在提高正面案例性能的同时,对负声音更具鲁棒性。我们的自监督模型SSL-SaN在声源定位和跨模态检索方面均实现了与其他自监督模型相比的领先性能。其次,我们提出了一种新的指标,用于量化声学和视觉特征在正负音频-视觉对之间对齐性与可分离性之间的权衡。最后,我们提供了IS3+数据集的一个扩展版本,包含负声音。我们的数据、指标和代码均可在https://xavijuanola.github.io/SSL-SaN/上获取。
引用
@article{arxiv.2508.21761,
title = {Learning from Silence and Noise for Visual Sound Source Localization},
author = {Xavier Juanola and Giovana Morais and Magdalena Fuentes and Gloria Haro},
journal= {arXiv preprint arXiv:2508.21761},
year = {2025}
}
备注
10 pages, 2 figures, 4 tables + Supplementary Material