中文

利用变换不变性与等变性进行自监督声音定位

计算机视觉与模式识别 2022-08-16 v2 多媒体 声音 音频与语音处理

摘要

我们提出了一种简单而有效的用于音视频表示学习的自监督框架,以定位视频中的声源。为了理解是什么使得学习有用的表示成为可能,我们系统地研究了数据增强的影响,并揭示出:(1) 数据增强的组合起着关键作用,即显式地鼓励音视频表示对各种变换保持不变(变换不变性);(2) 强制几何一致性显著提高了所学表示的质量,即检测到的声源应遵循应用于输入视频帧的相同变换(变换等变性)。大量实验表明,我们的模型在两个声音定位基准 Flickr-SoundNet 和 VGG-Sound 上显著优于先前的方法。此外,我们还评估了音频检索和跨模态检索任务。在这两种情况下,我们的自监督模型都展现出优越的检索性能,甚至在音频检索中与有监督方法具有竞争力。这表明所提出的框架学习了强大的多模态表示,有利于声音定位并泛化到进一步的应用。所有代码将公开可用。

关键词

引用

@article{arxiv.2206.12772,
  title  = {Exploiting Transformation Invariance and Equivariance for Self-supervised Sound Localisation},
  author = {Jinxiang Liu and Chen Ju and Weidi Xie and Ya Zhang},
  journal= {arXiv preprint arXiv:2206.12772},
  year   = {2022}
}

备注

Camera-ready Version for ACMMM 2022, Project page is https://jinxiang-liu.github.io/SSL-TIE/