使用文本与草图学习用于多目标图像检索的跨模态深度嵌入
计算机视觉与模式识别
2018-05-01 v1
摘要
在本工作中,我们提出了一种跨模态图像检索系统,允许将文本和草图作为查询的输入模态。我们构建了一个跨模态深度网络架构,以联合建模草图与文本输入模态以及图像输出模态,从而学习文本与图像之间以及草图与图像之间的共同嵌入。此外,我们使用注意力模型来选择性地将注意力聚焦于图像中的不同目标,从而允许在查询中包含多个目标进行检索。实验表明,所提出的方法在标准数据集上的单目标和多目标图像检索中均取得了最佳性能。
引用
@article{arxiv.1804.10819,
title = {Learning Cross-Modal Deep Embeddings for Multi-Object Image Retrieval using Text and Sketch},
author = {Sounak Dey and Anjan Dutta and Suman K. Ghosh and Ernest Valveny and Josep Lladós and Umapada Pal},
journal= {arXiv preprint arXiv:1804.10819},
year = {2018}
}
备注
Accepted at ICPR 2018