用于自动跨媒体检索的深度多模态图像-文本嵌入
信息检索
2020-02-28 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
本文考虑通过学习用于跨模态检索的视觉-文本嵌入空间来匹配图像与句子的任务。由于文本与图像的特征及表示不可直接比较,寻找这样的空间是一项具有挑战性的任务。在本工作中,我们引入一个端到端深度多模态卷积-循环网络,用于同时学习视觉与语言表示以推断图像-文本相似度。该模型利用基于 hinge 的三元组排序来学习哪些样本对是匹配(正例)哪些是不匹配(负例)。为学习联合表示,我们利用了新提取的 Twitter 推文集合。我们数据集的主要特点是图像与推文未像基准那样标准化。此外,相较于描述组织良好的基准,图片与推文之间可能存在更高的语义关联。在 MS-COCO 基准数据集上的实验结果表明,我们的模型优于此前提出的某些方法,并与最先进方法具有竞争力。代码与数据集已公开可用。
引用
@article{arxiv.2002.10016,
title = {Deep Multimodal Image-Text Embeddings for Automatic Cross-Media Retrieval},
author = {Hadi Abdi Khojasteh and Ebrahim Ansari and Parvin Razzaghi and Akbar Karimi},
journal= {arXiv preprint arXiv:2002.10016},
year = {2020}
}
备注
6 pages and 2 figures, Learn more about this project at https://iasbs.ac.ir/~ansari/deeptwitter