自监督预测学习:一种无负样本的视觉场景声源定位方法
计算机视觉与模式识别
2022-03-28 v1
摘要
视觉场景中的声源定位旨在给定图像中定位发出声音的物体。近期展现令人印象深刻的定位性能的工作通常依赖对比学习框架。然而,这些方法普遍采用的负样本随机采样会导致音频与视觉特征间错位,从而引发定位歧义。本文不同于既往文献,提出自监督预测学习(Self-Supervised Predictive Learning, SSPL),一种通过显式正样本挖掘实现无负样本的声源定位方法。具体而言,我们首先设计三流网络优雅地将声源与对应视频帧的两个增强视图相关联,从而得出音频与视觉特征间语义一致的相似性。其次,我们引入一种新颖的预测编码模块用于音视特征对齐。该模块协助 SSPL 以渐进方式聚焦于目标物体,并有效降低正样本对学习难度。实验展示出惊人结果:SSPL 在两个标准声源定位基准上优于当前最优(state-of-the-art, SOTA)方法。特别地,相较于先前最佳,SSPL 在 SoundNet-Flickr 上实现了 cIoU 提升 8.6% 与 AUC 提升 3.4%。代码见:https://github.com/zjsong/SSPL。
引用
@article{arxiv.2203.13412,
title = {Self-Supervised Predictive Learning: A Negative-Free Method for Sound Source Localization in Visual Scenes},
author = {Zengjie Song and Yuxi Wang and Junsong Fan and Tieniu Tan and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2203.13412},
year = {2022}
}
备注
Camera-ready, CVPR 2022. Code: https://github.com/zjsong/SSPL