通过深度语义嵌入从Web数据中学以学习
计算机视觉与模式识别
2018-08-21 v1
摘要
在本文中,我们提出从Web和社交媒体数据学习多模态图像与文本嵌入,旨在利用在文本域中学到的语义知识并将其迁移到视觉模型以进行语义图像检索。我们证明了该流水线可以在无监督情况下从带有相关文本的图像中学习,并在三个不同基准上对五种不同文本嵌入进行了透彻分析。我们表明,在基于文本的图像检索任务中,用Web和社交媒体数据学习的嵌入相对于监督方法具有竞争性性能,并且在目标数据上训练时我们在MIRFlickr数据集上明显优于当前最优(state of the art)。此外,我们展示了如何使用所学嵌入执行语义多模态图像检索,超越了经典的实例级检索问题。最后,我们提出一个新数据集InstaCities1M,由Instagram图像及其相关文本组成,可用于图像-文本嵌入的公平比较。
引用
@article{arxiv.1808.06368,
title = {Learning to Learn from Web Data through Deep Semantic Embeddings},
author = {Raul Gomez and Lluis Gomez and Jaume Gibert and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:1808.06368},
year = {2018}
}
备注
ECCV MULA Workshop 2018