中文

用于第一视角场景图像端到端词 spotting 的 Soft-PHOC 描述符

计算机视觉与模式识别 2019-10-14 v2

摘要

自然场景图像中的词 spotting 在场景理解与视觉辅助方面有许多应用。本文中,我们提出一种基于文本属性(即字符概率图)来创建并利用图像中间表示的技术。我们的表示扩展了金字塔字符直方图(PHOC)的概念,通过全卷积网络(Fully Convolutional Networks)推导候选词区域内字符分布的逐像素映射。我们称此表示为 Soft-PHOC。此外,我们展示了如何通过高效的文本行提议算法,将 Soft-PHOC 描述符用于第一视角相机流中的词 spotting 任务。该算法基于字符属性图上的霍夫变换(Hough Transform),随后使用动态时间规整(DTW)进行打分。我们在 ICDAR 2015 Challenge 4 数据集(由第一视角相机拍摄的偶发场景文本)上评估了我们的结果。

关键词

引用

@article{arxiv.1809.00854,
  title  = {Soft-PHOC Descriptor for End-to-End Word Spotting in Egocentric Scene Images},
  author = {Dena Bazazian and Dimosthenis Karatzas and Andrew D. Bagdanov},
  journal= {arXiv preprint arXiv:1809.00854},
  year   = {2019}
}

备注

9 pages, 10 figures, The Third International Workshop on Egocentric Perception, Interaction and Computing (EPIC) at ECCV2018