感知词长的文本定位:增强密集文本图像中的检测与识别
计算机视觉与模式识别
2023-12-27 v1
摘要
场景文本定位对于各种计算机视觉应用至关重要,能够实现从图像中提取和解释文本信息。然而,现有方法往往忽视词图像的空间语义,导致在密集场景中普遍存在的长尾词长分布下,长词和短词的检测召回率次优。在本文中,我们提出了 WordLenSpotter,一种新颖的感知词长场景文本图像检测与识别定位器,旨在提高对长词和短词的定位能力,特别是在密集文本图像的尾部数据中。我们首先设计了一个配备膨胀卷积融合模块的图像编码器,以有效整合多尺度文本图像特征。然后,利用 Transformer 框架,在使用词长先验迭代细化文本区域图像特征后,协同优化文本检测和识别精度。特别地,我们设计了一个空间长度预测器模块 (SLP),利用针对不同词长定制的字符计数先验来有效约束感兴趣区域。此外,我们引入了专门的感知词长分割 (LenSeg) 提议头,增强了网络在具有长尾分布特征的类别中捕捉长词和短词独特特征的能力。在公共数据集和我们自建的密集文本定位数据集 DSTD1500 上的综合实验证明了所提方法的优越性,特别是在涉及包含一系列长词和短词的长尾词长分布的密集文本图像检测和识别任务中。
引用
@article{arxiv.2312.15690,
title = {Word length-aware text spotting: Enhancing detection and recognition in dense text image},
author = {Hao Wang and Huabing Zhou and Yanduo Zhang and Tao Lu and Jiayi Ma},
journal= {arXiv preprint arXiv:2312.15690},
year = {2023}
}