单阶段场景文本检索
计算机视觉与模式识别
2018-08-29 v1
摘要
场景图像中的文本信息提供了关于图像及其上下文的高层语义信息,可用于更好的场景理解。本文研究场景文本检索问题:给定文本查询,系统须返回所有包含该查询文本的图像。所提模型的新颖之处在于使用单阶段 CNN 架构,同时预测边界框及其中单词的紧凑文本表示。由此,基于文本的图像检索任务可转化为对 CNN 在整个图像数据库上输出的查询文本表示的简单最近邻搜索。我们的实验表明,所提架构在性能上优于先前 SOTA,同时处理速度显著提升。
引用
@article{arxiv.1808.09044,
title = {Single Shot Scene Text Retrieval},
author = {Lluís Gómez and Andrés Mafla and Marçal Rusiñol and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:1808.09044},
year = {2018}
}
备注
ECCV 2018