中文

对视觉声源定位模型的批判性评估:包含负声音

计算机视觉与模式识别 2025-01-14 v3 声音 音频与语音处理

摘要

视觉声源定位(VSSL)任务涉及在视觉场景中识别声源位置,整合音视频数据以增强场景理解。尽管已取得的前沿(SOTA)模型在此方面取得进展,但我们观察到三个关键缺陷:i)模型的评估主要集中在图像中可见的对象产生的声音;ii)评估常常假设对发声对象大小的先验知识;iii)尚未建立适用于实际场景的通用定位阈值,因为以往方法仅考虑正例,而不考虑正负案例。本文引入了一套新型测试集和指标,以完整评估当前标准的 VSSL 模型,测试其中在图像中无对象对应音频输入的场景,即负声音情形。我们考虑三种负声音类型:静音、噪声和离屏。我们的分析表明,许多 SOTA 模型未能根据音频输入适当调整其预测,表明这些模型可能未如预期地利用音频信息。此外,我们对估计的音视频相似性图中最大值的范围进行了全面分析,涵盖正负声音情况,表明大多数模型在判别性上不足,以至于无法选择无需发声对象尺寸和可见性先验信息的通用阈值进行声源定位。

关键词

引用

@article{arxiv.2410.01020,
  title  = {A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio},
  author = {Xavier Juanola and Gloria Haro and Magdalena Fuentes},
  journal= {arXiv preprint arXiv:2410.01020},
  year   = {2025}
}

备注

Accepted in ICASSP 2025