用于文本识别的定位字符区域注意力
计算机视觉与模式识别
2020-07-21 v1
摘要
场景文本识别器由文本检测与识别模块组成。已有许多研究致力于将这些模块统一为端到端可训练模型以获得更好性能。一种典型架构将检测与识别模块置于分离的分支中,并通常使用RoI池化使分支共享视觉特征。然而,当采用基于注意力解码器的识别器与表征字符区域空间信息的检测器时,仍存在建立模块间更具互补性连接的可能。这之所以可行,是因为两个模块共享一个寻找字符区域位置的子任务。基于该见解,我们构建了一个紧密耦合的单流水线模型。该架构通过在识别器中利用检测输出并将识别损失反向传播至检测阶段而形成。字符得分图的使用有助于识别器更好地关注字符中心点,而识别损失向检测器模块的传播增强了字符区域的定位。此外,一个强化共享阶段允许对任意形状文本区域进行特征校正与边界定位。大量实验在公开的直线与弯曲基准数据集上展示了最先进的性能。
引用
@article{arxiv.2007.09629,
title = {Character Region Attention For Text Spotting},
author = {Youngmin Baek and Seung Shin and Jeonghun Baek and Sungrae Park and Junyeop Lee and Daehyun Nam and Hwalsuk Lee},
journal= {arXiv preprint arXiv:2007.09629},
year = {2020}
}
备注
17 pages, 9 figures, Accepted by ECCV 2020