中文

从变分跨模态生成学习视听相关性

计算机视觉与模式识别 2021-02-16 v2 声音 音频与语音处理 图像与视频处理

摘要

人们可以在看到某个事件时轻松想象其潜在声音。音频与视觉信号之间的这种自然同步揭示了它们的内在相关性。为此,我们提出以自监督的方式从跨模态生成的视角学习视听相关性,所学相关性可随即应用于多个下游任务,如视听跨模态定位与检索。我们引入了一种新颖的变分自编码器(Variational AutoEncoder, VAE)框架,其由多个编码器与一个共享解码器(MS-VAE)组成,并带有额外的 Wasserstein 距离约束以应对该问题。大量实验表明,所提 MS-VAE 的优化潜表示能有效学习视听相关性,并可直接应用于多个视听下游任务,即便训练期间无任何给定标签信息也能取得有竞争力的性能。

关键词

引用

@article{arxiv.2102.03424,
  title  = {Learning Audio-Visual Correlations from Variational Cross-Modal Generation},
  author = {Ye Zhu and Yu Wu and Hugo Latapie and Yi Yang and Yan Yan},
  journal= {arXiv preprint arXiv:2102.03424},
  year   = {2021}
}

备注

Accepted to ICASSP 2021