从语义相似样本中更好地学习声音定位
计算机视觉与模式识别
2022-02-08 v1 声音
音频与语音处理
图像与视频处理
摘要
本工作的目标是在视觉场景中定位声源。现有的音视工作采用对比学习,将来自同一源头的对应音视对指定为正样本,而将随机错配的对指定为负样本。然而,这些负样本对可能包含语义匹配的音视信息。因此,这些语义相关的对("困难正样本")被错误地归为负样本。我们的关键贡献在于表明困难正样本能够给出与对应对相似的响应图。我们的方法通过将其响应图直接加入对比学习目标来纳入这些困难正样本。我们在VGG-SS和SoundNet-Flickr测试集上展示了我们方法的有效性,显示出优于最先进方法的性能。
引用
@article{arxiv.2202.03007,
title = {Learning Sound Localization Better From Semantically Similar Samples},
author = {Arda Senocak and Hyeonggon Ryu and Junsik Kim and In So Kweon},
journal= {arXiv preprint arXiv:2202.03007},
year = {2022}
}
备注
Accepted to ICASSP 2022. SOTA performance in Audio-Visual Sound Localization. 5 Pages