学习保持结构的深度图文嵌入
计算机视觉与模式识别
2016-04-15 v2 计算与语言
机器学习
摘要
本文提出了一种学习图像与文本联合嵌入的方法,该方法使用一个双分支神经网络,包含多层线性投影及随后的非线性层。该网络使用大间隔目标函数进行训练,该目标函数将跨视图排序约束与受度量学习文献启发的视图内邻域结构保持约束相结合。大量实验表明,我们的方法在图像到文本和文本到图像检索的准确率上获得了显著提升。我们的方法在 Flickr30K 和 MSCOCO 图像-句子数据集上取得了新的 SOTA 结果,并在 Flickr30K Entities 数据集上的短语定位新任务中展现出良好前景。
引用
@article{arxiv.1511.06078,
title = {Learning Deep Structure-Preserving Image-Text Embeddings},
author = {Liwei Wang and Yin Li and Svetlana Lazebnik},
journal= {arXiv preprint arXiv:1511.06078},
year = {2016}
}