从变分跨模态生成学习视听相关性
计算机视觉与模式识别
2021-02-16 v2 声音
音频与语音处理
图像与视频处理
摘要
人们可以在看到某个事件时轻松想象其潜在声音。音频与视觉信号之间的这种自然同步揭示了它们的内在相关性。为此,我们提出以自监督的方式从跨模态生成的视角学习视听相关性,所学相关性可随即应用于多个下游任务,如视听跨模态定位与检索。我们引入了一种新颖的变分自编码器(Variational AutoEncoder, VAE)框架,其由多个编码器与一个共享解码器(MS-VAE)组成,并带有额外的 Wasserstein 距离约束以应对该问题。大量实验表明,所提 MS-VAE 的优化潜表示能有效学习视听相关性,并可直接应用于多个视听下游任务,即便训练期间无任何给定标签信息也能取得有竞争力的性能。
引用
@article{arxiv.2102.03424,
title = {Learning Audio-Visual Correlations from Variational Cross-Modal Generation},
author = {Ye Zhu and Yu Wu and Hugo Latapie and Yi Yang and Yan Yan},
journal= {arXiv preprint arXiv:2102.03424},
year = {2021}
}
备注
Accepted to ICASSP 2021