中文

一种面向细粒度跨媒体检索的新基准与新方法

信息检索 2019-11-01 v2 计算机视觉与模式识别 机器学习 多媒体

摘要

跨媒体检索是指返回与任意媒体类型查询相对应的各种媒体类型的结果。现有研究一般聚焦于粗粒度跨媒体检索。当用户提交一张“灰背鸥”的图像作为查询时,粗粒度跨媒体检索将其视为“鸟”,从而用户只能得到“鸟”的结果,其中可能包含其他外观相似(图像和视频)、描述(文本)或声音(音频)相似的鸟类,如“银鸥”。这种粗粒度跨媒体检索不符合人类生活方式,我们通常具有细粒度需求,即返回“灰背鸥”而非“银鸥”的精确相关结果。然而,极少有研究关注细粒度跨媒体检索,这是一项极具挑战且实用的任务。因此,本文首先构建了一个面向细粒度跨媒体检索的新基准,其由“鸟”的200个细粒度子类组成,并包含图像、文本、视频和音频4种媒体类型。据我们所知,这是首个包含4种媒体类型的细粒度跨媒体检索基准。然后,我们提出了一种统一的深度模型,即FGCrossNet,其同时学习4种媒体类型而无需区别对待。为更好地学习公共表示,我们联合考虑三种约束:分类约束确保判别性特征的学习,中心约束确保同一子类特征的紧致特性,排序约束确保不同子类特征的稀疏特性。大量实验验证了新基准的实用性和我们所提FGCrossNet的有效性。它们将于https://github.com/PKU-ICST-MIPL/FGCrossNet_ACMMM2019提供。

关键词

引用

@article{arxiv.1907.04476,
  title  = {A New Benchmark and Approach for Fine-grained Cross-media Retrieval},
  author = {Xiangteng He and Yuxin Peng and Liu Xie},
  journal= {arXiv preprint arXiv:1907.04476},
  year   = {2019}
}

备注

9 pages, ACM MM 2019