STEP——面向结构化场景文本 spotting
计算机视觉与模式识别
2023-12-12 v2
摘要
我们引入了结构化场景文本 spotting 任务,该任务要求场景文本 OCR 系统根据查询正则表达式在野外定位文本。与通用场景文本 OCR 不同,结构化场景文本 spotting 旨在根据用户提供的正则表达式动态调节场景文本检测与识别。为应对该任务,我们提出了结构化文本定位器(Structured TExt sPotter, STEP),这是一种利用所提供的文本结构来引导 OCR 过程的模型。STEP 能够处理包含空格的正则表达式,且不局限于词级别的检测粒度。我们的方法能够在多种真实世界阅读场景中实现准确的零样本结构化文本 spotting,并且仅使用公开可用数据进行训练。为证明我们方法的有效性,我们引入了一个新的具有挑战性的测试数据集,其中包含多种类型的词汇表外结构化文本,反映了价格、日期、序列号、车牌等重要阅读应用领域。我们证明了 STEP 能在所有测试场景中按需提供专门的 OCR 性能。
引用
@article{arxiv.2309.02356,
title = {STEP -- Towards Structured Scene-Text Spotting},
author = {Sergi Garcia-Bordils and Dimosthenis Karatzas and Marçal Rusiñol},
journal= {arXiv preprint arXiv:2309.02356},
year = {2023}
}
备注
15 pages, 11 figures