中文

基于聚类典型相关分析与深度三元神经网络的音视频跨模态检索

多媒体 2021-05-06 v3 信息检索

摘要

跨模态检索旨在以某一模态的查询检索另一模态的数据,已成为多媒体、信息检索、计算机视觉及数据库领域非常有趣的研究课题。现有工作多关注文本-图像、文本-视频及歌词-音频间的跨模态检索。由于音视频配对数据集与语义信息有限,鲜有研究涉及音频与视频间的跨模态检索。音视频跨模态检索任务的主要挑战在于从共享子空间中学习联合嵌入以计算跨模态相似度,其中生成新表示旨在最大化音频与视觉模态空间间的相关性。本文提出一种新颖的带聚类典型相关分析的深度三元神经网络(TNN-C-CCA),这是一种具有音频分支与视频分支的端到端监督学习架构。我们在最大化相关性时不仅考虑公共空间中的匹配对,还计算非匹配对。具体贡献有二:i)通过构建带三元组损失的深度三元神经网络生成更优表示,以获得最优投影,从而在共享子空间中最大化相关性;ii)在学习阶段使用正例与负例以提升音视频间嵌入学习能力。实验采用 5 折交叉验证,以平均性能展示音视频跨模态检索表现。在两个不同音视频数据集上的实验结果表明,所提双分支学习架构优于现有六种基于 CCA 的方法及四种最先进的跨模态检索方法。

关键词

引用

@article{arxiv.1908.03737,
  title  = {Deep Triplet Neural Networks with Cluster-CCA for Audio-Visual Cross-modal Retrieval},
  author = {Donghuo Zeng and Yi Yu and Keizo Oyama},
  journal= {arXiv preprint arXiv:1908.03737},
  year   = {2021}
}

备注

21 pages,11 figures