基于类别的深度典型相关分析用于多模态数据的细粒度场所发现
计算机视觉与模式识别
2018-05-09 v1
摘要
本文将旅行目的地和商业地点视为场所。通过照片发现场所对于上下文感知应用十分重要。遗憾的是,少有研究关注诸如用户生成的场所照片等复杂真实图像。我们的目标是从异构社交多模态数据中进行细粒度场所发现。为此,我们提出一种新颖的深度学习模型——基于类别的深度典型相关分析(C-DCCA)。给定一张照片作为输入,该模型通过输入照片与场所文本描述之间的跨模态相关性,执行(i)精确场所搜索(找到拍摄该照片的场所),以及(ii)群组场所搜索(找到与该照片类别相同的相关场所)。在该模型中,不同模态的数据通过深度网络投影到同一空间。用于精确场所搜索的成对相关性(来自同一场所的不同模态数据之间)与用于群组场所搜索的基于类别的相关性(来自不同场所但类别相同的不同模态数据之间)被联合优化。由于一张照片无法充分反映场所丰富的文本描述,训练阶段增加了每个场所的照片数量以捕捉场所的更多方面。我们通过整合维基百科特色文章和Foursquare场所照片构建了一个新的场所感知多模态数据集。在该数据集上的实验结果证实了所提方法的可行性。此外,在另一个公开可用数据集上的评估表明,所提方法在图像与文本的跨模态检索方面优于最先进方法。
引用
@article{arxiv.1805.02997,
title = {Category-Based Deep CCA for Fine-Grained Venue Discovery from Multimodal Data},
author = {Yi Yu and Suhua Tang and Kiyoharu Aizawa and Akiko Aizawa},
journal= {arXiv preprint arXiv:1805.02997},
year = {2018}
}