中文

用于自动跨媒体检索的深度多模态图像-文本嵌入

信息检索 2020-02-28 v1 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

本文考虑通过学习用于跨模态检索的视觉-文本嵌入空间来匹配图像与句子的任务。由于文本与图像的特征及表示不可直接比较,寻找这样的空间是一项具有挑战性的任务。在本工作中,我们引入一个端到端深度多模态卷积-循环网络,用于同时学习视觉与语言表示以推断图像-文本相似度。该模型利用基于 hinge 的三元组排序来学习哪些样本对是匹配(正例)哪些是不匹配(负例)。为学习联合表示,我们利用了新提取的 Twitter 推文集合。我们数据集的主要特点是图像与推文未像基准那样标准化。此外,相较于描述组织良好的基准,图片与推文之间可能存在更高的语义关联。在 MS-COCO 基准数据集上的实验结果表明,我们的模型优于此前提出的某些方法,并与最先进方法具有竞争力。代码与数据集已公开可用。

关键词

引用

@article{arxiv.2002.10016,
  title  = {Deep Multimodal Image-Text Embeddings for Automatic Cross-Media Retrieval},
  author = {Hadi Abdi Khojasteh and Ebrahim Ansari and Parvin Razzaghi and Akbar Karimi},
  journal= {arXiv preprint arXiv:2002.10016},
  year   = {2020}
}

备注

6 pages and 2 figures, Learn more about this project at https://iasbs.ac.ir/~ansari/deeptwitter