结合典型相关分析的变分自编码器用于音视频跨模态检索
信息检索
2021-12-07 v1
摘要
跨模态检索是利用一种模态作为查询来检索另一种模态的数据,已成为信息检索、机器学习和数据库中的热门话题。如何有效度量不同模态数据之间的相似性是跨模态检索的主要挑战。尽管若干研究工作通过学习公共子空间表示来计算不同模态数据间的相关性,但编码器从多模态信息中提取特征的能力尚不令人满意。本文提出一种新颖的变分自编码器(VAE)架构用于音视频跨模态检索,通过学习成对的音视频相关性嵌入与类别相关性嵌入作为约束,以增强音视频信息的互异性。一方面,音频编码器和视觉编码器分别将音频数据和视觉数据编码到两个不同的潜空间,进而通过典型相关分析(CCA)分别构建两个互潜空间。另一方面,采用概率建模方法处理数据中可能存在的噪声与缺失信息。此外,通过这种方式,联合嵌入子空间中同时消除了来自模态内与模态间的跨模态差异。我们在两个基准数据集上进行了大量实验,实验结果表明所提架构能有效学习音视频相关性,并显著优于现有跨模态检索方法。
引用
@article{arxiv.2112.02601,
title = {Variational Autoencoder with CCA for Audio-Visual Cross-Modal Retrieval},
author = {Jiwei Zhang and Yi Yu and Suhua Tang and Jianming Wu and Wei Li},
journal= {arXiv preprint arXiv:2112.02601},
year = {2021}
}