结合 CCA 投影与成对排序损失的端到端跨模态检索
信息检索
2018-04-17 v2
摘要
跨模态检索涵盖检索到的项目与搜索查询属于不同类型的检索任务,例如检索与给定文本查询相关的图片。跨模态检索的最先进方法依赖于学习两种模态的联合嵌入空间,在该空间中通过最近邻搜索检索任一模态的项目。在本工作中,我们引入了一种基于典型相关分析 (CCA) 的神经网络层,该层通过解析计算最大化相关性的投影来学习更好的嵌入空间。与以往方法不同,CCA 层 (CCAL) 允许我们将现有的嵌入空间学习目标(如成对排序损失)与 CCA 的最优投影相结合。我们在三种不同场景(文本-图像、音频-乐谱和零样本检索)下展示了该方法在跨模态检索中的有效性,超越了使用由成对排序损失优化的自由学习投影的 Deep CCA 和多视图网络,尤其是在训练数据较少的情况下(这三种方法的代码已发布于:https://github.com/CPJKU/cca_layer)。
引用
@article{arxiv.1705.06979,
title = {End-to-End Cross-Modality Retrieval with CCA Projections and Pairwise Ranking Loss},
author = {Matthias Dorfer and Jan Schlüter and Andreu Vall and Filip Korzeniowski and Gerhard Widmer},
journal= {arXiv preprint arXiv:1705.06979},
year = {2018}
}
备注
Preliminary version of a paper published in the International Journal of Multimedia Information Retrieval