在脑海中描绘:从文本描述生成高层视觉表征
信息检索
2018-09-05 v1 计算与语言
计算机视觉与模式识别
神经与进化计算
摘要
本文处理当查询为用户所寻图像的简短文本描述时的图像搜索问题。我们选择通过学习将文本查询转换为视觉表征,在视觉特征空间中实现实际的搜索过程,即相似性搜索。在视觉特征空间中搜索的优势在于,对转换模型的任何更新都无需重新处理通常规模庞大的待搜索图像集合。我们提出 Text2Vis,一种从简短描述性文本生成视觉表征的神经网络,该表征位于 ImageNet 的 fc6-fc7 层视觉特征空间中。Text2Vis 使用随机损失选择方法优化两个损失函数。视觉聚焦损失旨在学习实际的文本到视觉特征映射,而文本聚焦损失则旨在建模语言中表达的高层语义概念,并抑制对视觉损失中非相关视觉成分的过拟合。我们在 MS-COCO 数据集上报告了初步结果。
引用
@article{arxiv.1606.07287,
title = {Picture It In Your Mind: Generating High Level Visual Representations From Textual Descriptions},
author = {Fabio Carrara and Andrea Esuli and Tiziano Fagni and Fabrizio Falchi and Alejandro Moreo Fernández},
journal= {arXiv preprint arXiv:1606.07287},
year = {2018}
}
备注
Neu-IR '16 SIGIR Workshop on Neural Information Retrieval, July 21, 2016, Pisa, Italy