中文

多媒体检索中无监督视觉与文本信息融合——基于图的视角

信息检索 2014-01-28 v1

摘要

多媒体集合在规模和多样性上不断增长。有效的多媒体检索系统对于从最终用户角度以可扩展方式访问这些数据集至关重要。我们关注图像/文本多媒体对象库,并研究基于内容的多媒体信息检索中的多模态信息融合技术。我们专注于图方法,这些方法已被证明能提供最先进的性能。我们特别考察了两种方法:跨媒体相似度和基于随机游走的分数。从理论角度,我们提出了一个统一的基于图的框架,涵盖了上述两种方法。我们的提议使我们能够突出在使用基于图的技术结合视觉和文本信息时应考虑的核心特征。我们使用三个不同的真实世界数据集比较了跨媒体和基于随机游走的结果。从实践角度,我们扩展的实证分析使我们能够提供关于在基于内容的多媒体信息检索中使用基于图的方法进行多模态信息融合的见解和指南。

关键词

引用

@article{arxiv.1401.6891,
  title  = {Unsupervised Visual and Textual Information Fusion in Multimedia Retrieval - A Graph-based Point of View},
  author = {Gabriela Csurka and Julien Ah-Pine and Stéphane Clinchant},
  journal= {arXiv preprint arXiv:1401.6891},
  year   = {2014}
}

备注

An extended version of the paper: Visual and Textual Information Fusion in Multimedia Retrieval using Semantic Filtering and Graph based Methods, by J. Ah-Pine, G. Csurka and S. Clinchant, submitted to ACM Transactions on Information Systems