重新审视跨模态检索
计算机视觉与模式识别
2018-07-20 v1
摘要
本文提出了一种利用图像与文本编码的跨模态检索系统。大多数多模态架构为每个模态采用独立的网络以捕捉它们之间的语义关系。然而,在我们的工作中,图像-文本编码无需为每个模态使用独立网络即可在跨模态检索方面取得可比的结果。我们表明文本编码能够捕捉多个模态之间的语义关系。据我们所知,这项工作在采用单一网络与融合的图像-文本嵌入进行跨模态检索方面尚属首例。我们在两个著名的多模态数据集 MS-COCO 和 Flickr30K 上评估了我们的方法。
引用
@article{arxiv.1807.07364,
title = {Revisiting Cross Modal Retrieval},
author = {Shah Nawaz and Muhammad Kamran Janjua and Alessandro Calefati and Ignazio Gallo},
journal= {arXiv preprint arXiv:1807.07364},
year = {2018}
}
备注
14 pages. Under review at ECCVW (MULA 2018)