中文

基于假阴性感知对比学习的音视觉源定位学习

计算机视觉与模式识别 2023-03-28 v2

摘要

自监督音视觉源定位旨在无需额外标注的情况下定位视频帧中的声源物体。近期方法常借助对比学习来实现该目标,其假设仅来自同一视频的音频与视觉内容互为正样本。然而,该假设在真实世界训练中会受假阴性样本影响。例如,对于某个音频样本,将同一音频类别的帧视为负样本可能误导模型,从而损害所学表征(例如,警笛鸣叫的音频可能合理地对应多张图像中的救护车)。基于该观察,我们提出一种名为假阴性感知对比(False Negative Aware Contrastive, FNAC)的新学习策略,以缓解此类假阴性样本误导训练的问题。具体而言,我们利用模态内相似度识别潜在相似样本,并构建相应的邻接矩阵来引导对比学习。此外,我们提出通过显式利用声源视觉特征来强化真负样本的作用,以促进对真实发声源区域的区分。FNAC 在 Flickr-SoundNet、VGG-Sound 和 AVSBench 上取得了最先进的性能,证明了我们的方法在缓解假阴性问题上的有效性。代码见 \url{https://github.com/OpenNLPLab/FNAC_AVL}。

关键词

引用

@article{arxiv.2303.11302,
  title  = {Learning Audio-Visual Source Localization via False Negative Aware Contrastive Learning},
  author = {Weixuan Sun and Jiayi Zhang and Jianyuan Wang and Zheyuan Liu and Yiran Zhong and Tianpeng Feng and Yandong Guo and Yanhao Zhang and Nick Barnes},
  journal= {arXiv preprint arXiv:2303.11302},
  year   = {2023}
}

备注

CVPR2023