中文

面向图像-文本同步可视化的多模态关系数据随机邻域嵌入

机器学习 2020-05-05 v1 计算与语言 计算机视觉与模式识别 人机交互 机器学习

摘要

近年来,多模态关系数据分析日益重要,用于跨不同数据域进行探索,例如从社交网络服务(如 Flickr)获取的图像及其文本标签。已开发多种用于可视化的数据分析方法;举例而言,t-随机邻域嵌入(t-SNE)计算低维特征向量,使其相似度保持观测数据向量的相似度。然而,t-SNE 仅针对单一数据域设计,而非针对多模态数据;本文旨在可视化由多个域中数据向量及这些向量间关系构成的多模态关系数据。通过扩展 t-SNE,我们在此提出多模态关系随机邻域嵌入(MR-SNE),其(1)首先计算增强关系,其中我们观察跨域关系并通过观测数据向量计算各域内部关系,以及(2)将增强关系联合嵌入低维空间。通过对 Flickr 与 Animal with Attributes 2 数据集的可视化,所提 MR-SNE 与其他基于图嵌入的方法进行比较;MR-SNE 展现出 promising 的性能。

关键词

引用

@article{arxiv.2005.00670,
  title  = {Stochastic Neighbor Embedding of Multimodal Relational Data for Image-Text Simultaneous Visualization},
  author = {Morihiro Mizutani and Akifumi Okuno and Geewook Kim and Hidetoshi Shimodaira},
  journal= {arXiv preprint arXiv:2005.00670},
  year   = {2020}
}

备注

20 pages, 23 figures