模态依赖的跨媒体检索
计算机视觉与模式识别
2015-06-24 v2 信息检索
机器学习
摘要
在本文中,我们研究图像与文本之间的跨媒体检索,即使用图像检索文本(I2T)和使用文本检索图像(T2I)。现有的跨媒体检索方法通常学习一对投影,将图像和文本的原始特征投影到一个公共潜在空间以度量内容相似性。然而,对两种不同的检索任务(I2T 和 T2I)使用相同的投影可能导致它们各自性能之间的折衷,而非最佳性能。与以往工作不同,我们提出一种模态依赖的跨媒体检索(MDCR)模型,其中为不同的跨媒体检索任务学习两对投影,而非一对投影。具体而言,通过联合优化图像与文本之间的相关性以及从一个模态空间(图像或文本)到语义空间的线性回归,学习两对映射将图像和文本从其原始特征空间投影到两个公共潜在子空间(一个用于 I2T,另一个用于 T2I)。大量实验显示了所提 MDCR 相较于其他方法的优越性。特别地,基于 4,096 维卷积神经网络(CNN)视觉特征和 100 维 LDA 文本特征,所提方法的 mAP 达到 41.5\%,这是 Wikipedia 数据集上新的最先进性能。
引用
@article{arxiv.1506.06628,
title = {Modality-dependent Cross-media Retrieval},
author = {Yunchao Wei and Yao Zhao and Zhenfeng Zhu and Shikui Wei and Yanhui Xiao and Jiashi Feng and Shuicheng Yan},
journal= {arXiv preprint arXiv:1506.06628},
year = {2015}
}
备注
in ACM Transactions on Intelligent Systems and Technology