中文

基于隐式概念关联的跨模态检索

计算机视觉与模式识别 2018-04-26 v2 人工智能 多媒体

摘要

传统跨模态检索假设模态间概念存在显式关联,即概念如何相互链接没有歧义,例如当我们用查询“狗”进行图像搜索时,期望看到狗的图像。本文考虑一种不同的跨模态检索设定,其中来自不同模态的数据通过必须由高层推理推断出的概念隐式链接;我们称此设定为隐式概念关联。为促进该设定下的未来研究,我们提出一个包含从网络爬取的47K对动画GIF与句子的新数据集,其中GIF描绘了针对文本所描述场景的身体或情绪反应(称为“反应GIF”)。我们报告了一项用户研究,表明尽管存在隐式概念关联,人类仍能够识别具有匹配概念的图像-句子对,说明我们任务的可行性。此外,我们提出一种基于多示例学习的新型视觉-语义嵌入网络。与传统方法不同,我们从每个模态计算多个嵌入,每个代表不同概念,并在多示例学习框架下通过考虑所有视觉-语义嵌入的可能组合来度量其相似性。我们在具有显式与隐式概念关联的两个视频-句子数据集上评估了我们的方法,并报告了相对于现有跨模态检索方法的具有竞争力的结果。

关键词

引用

@article{arxiv.1804.04318,
  title  = {Cross-Modal Retrieval with Implicit Concept Association},
  author = {Yale Song and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:1804.04318},
  year   = {2018}
}