利用自顶向下线索增强场景文本识别的能量最小化框架
计算机视觉与模式识别
2016-03-24 v1
摘要
识别场景文本是一个具有挑战性的问题,甚至比扫描文档的识别更具挑战性。近年来该问题引起了计算机视觉界的显著关注,并且已经提出了几种基于能量最小化框架和深度学习方法的方法。在本工作中,我们专注于能量最小化框架,并提出了一种利用自底向上和自顶向下线索来识别从街景图像中提取的裁剪单词的模型。自底向上线索源自图像中单个字符的检测。我们在这些检测上构建了一个条件随机场模型,以联合建模检测的强度以及它们之间的相互作用。这些相互作用是得自基于词典的先验(即语言统计)的自顶向下线索。表示文本图像的最优单词通过最小化对应于随机场模型的能量函数获得。我们在多个裁剪场景文本基准数据集上广泛评估了我们提出的算法,即Street View Text、ICDAR 2003、2011和2013数据集,以及IIIT 5K-word,并展示了比可比方法更好的性能。我们对方法中所有步骤进行了严格分析并分析了结果。我们还展示了最先进的卷积神经网络特征可以集成到我们的框架中以进一步改进识别性能。
引用
@article{arxiv.1601.03128,
title = {Enhancing Energy Minimization Framework for Scene Text Recognition with Top-Down Cues},
author = {Anand Mishra and Karteek Alahari and C. V. Jawahar},
journal= {arXiv preprint arXiv:1601.03128},
year = {2016}
}