基于迭代对比学习的无监督声音定位
计算机视觉与模式识别
2021-04-02 v1 声音
音频与语音处理
图像与视频处理
摘要
声音定位旨在视觉场景中找出音频信号的来源。然而,对从音频和视觉模态采样的信号之间的相关性进行标注是劳动密集型的,从而难以监督机器学习该任务。在这项工作中,我们提出了一种无需数据标注的迭代对比学习框架。在每次迭代中,所提方法将 1) 前一次迭代中预测的图像定位结果,以及 2) 从音频信号推断的语义关系作为伪标签。然后我们使用伪标签来学习从同一视频中采样的视觉与音频信号之间的相关性(帧内采样),以及跨视频提取的那些信号之间的关联(帧间关系)。我们的迭代策略逐渐促进发声物体的定位,并降低非发声区域与参考音频之间的相关性。定量和定性实验结果表明,所提框架在声音定位任务上优于现有的无监督和弱监督方法。
引用
@article{arxiv.2104.00315,
title = {Unsupervised Sound Localization via Iterative Contrastive Learning},
author = {Yan-Bo Lin and Hung-Yu Tseng and Hsin-Ying Lee and Yen-Yu Lin and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2104.00315},
year = {2021}
}