LEWIS:词图像及其语义的潜在嵌入
计算机视觉与模式识别
2015-09-22 v1
摘要
本工作的目标是将语义引入自然图像中的文本识别与检索任务。尽管文本识别与检索近年来备受关注,先前工作侧重于识别或检索与查询完全相同的词,而未考虑语义。在本文中,我们提出以下问题:\emph{我们能否直接从一个词图像预测语义概念,而无需在任何时候显式地转写该词图像或其字符?} 为此目标,我们提出了一种带加权排序损失目标的卷积神经网络(CNN),其确保与查询图像相关的概念排在无关概念之前。这也可被解释为学习一个词图像与概念联合嵌入的欧几里得空间。该模型以端到端方式从图像像素学到语义概念,使用了一个由合成生成的词图像数据集以及从词汇数据库(WordNet)中挖掘的概念。我们的结果表明,尽管任务复杂,词图像与概念确实能够以很高的准确度相关联。
引用
@article{arxiv.1509.06243,
title = {LEWIS: Latent Embeddings for Word Images and their Semantics},
author = {Albert Gordo and Jon Almazan and Naila Murray and Florent Perronnin},
journal= {arXiv preprint arXiv:1509.06243},
year = {2015}
}
备注
Accepted for publication at the International Conference on Computer Vision (ICCV) 2015