利用标题与点击数据实现多任务文本到视觉嵌入
计算机视觉与模式识别
2019-06-03 v1 信息检索
摘要
文本-视觉(或称语义-视觉)嵌入是视觉-语言研究的核心问题。它通常通过一个CNN图像编码器和一个RNN语言编码器将图像和文本描述映射到共同特征空间。本文提出一种利用图像搜索引擎中的图像标题和点击数据来学习文本-视觉嵌入的新方法。我们还通过建模嵌入的正样本感知提出了一种新的三元组损失函数,并引入一种新颖的基于小批量的难负样本采样方法以提高学习过程中的数据效率。实验结果表明,我们提出的方法优于现有方法,并且对真实世界的文本到视觉检索也有效。
引用
@article{arxiv.1905.13339,
title = {Multitask Text-to-Visual Embedding with Titles and Clickthrough Data},
author = {Pranav Aggarwal and Zhe Lin and Baldo Faieta and Saeid Motiian},
journal= {arXiv preprint arXiv:1905.13339},
year = {2019}
}
备注
4 pages. Language and Vision Workshop, in conjunction with CVPR 2019