中文

细察弱监督音视觉源定位

声音 2022-09-21 v1 计算机视觉与模式识别 机器学习 多媒体

摘要

音视觉源定位是一项具有挑战性的任务,旨在预测视频中视觉声源的位置。由于收集发声物体的真值标注可能代价高昂,近年来提出了大量可从无边界框标注数据集中学习的弱监督定位方法,通过利用音频和视觉信号的自然共现性。尽管兴趣浓厚,流行的评估协议存在两个主要缺陷。首先,它们允许使用完全标注的数据集来执行早停,从而显著增加了训练所需的标注工作量。其次,当前的评估指标假设声音源始终存在。这当然是不现实的假设,因此需要更好的指标来捕捉模型在无可视频声源的负样本上的性能。为此,我们扩展了流行基准 Flickr SoundNet 和 VGG-Sound Sources 的测试集,以纳入负样本,并使用平衡定位精度与召回率的指标来衡量性能。使用新协议,我们对先前方法进行了广泛评估,发现大多数先前工作无法识别负样本,并且存在严重的过拟合问题(严重依赖早停以获得最佳结果)。我们还提出了一种新的视觉声源定位方法,解决了这两个问题。特别地,我们发现,通过极端视觉 dropout 和动量编码器的使用,所提方法有效对抗过拟合,并在 Flickr SoundNet 和 VGG-Sound Source 上建立了新的 SOTA 性能。代码和预训练模型可在 https://github.com/stoneMo/SLAVC 获取。

关键词

引用

@article{arxiv.2209.09634,
  title  = {A Closer Look at Weakly-Supervised Audio-Visual Source Localization},
  author = {Shentong Mo and Pedro Morgado},
  journal= {arXiv preprint arXiv:2209.09634},
  year   = {2022}
}