基于二维自注意力识别任意形状文本
计算机视觉与模式识别
2019-10-11 v1
摘要
场景文本识别(STR)是自然场景中字符序列识别的任务。尽管 STR 方法已取得巨大进展,现有方法仍无法识别任意形状的文本,例如日常生活中大量存在的严重弯曲或旋转文本(如餐厅招牌、产品标签、公司徽标等)。本文提出一种用于识别任意形状文本的新颖架构,称为自注意力文本识别网络(SATRN),其受 Transformer 启发。SATRN 利用自注意力机制描述场景文本图像中字符的二维(2D)空间依赖关系。借助自注意力的全图传播,SATRN 能够识别任意排布及字符间距较大的文本。结果表明,SATRN 在“不规则文本”基准上以平均 5.7 个百分点(pp)的优势大幅优于现有 STR 模型。我们提供了经验分析以阐明其内部机制及模型的适用程度(如旋转与多行文本)。我们将开源代码。
引用
@article{arxiv.1910.04396,
title = {On Recognizing Texts of Arbitrary Shapes with 2D Self-Attention},
author = {Junyeop Lee and Sungrae Park and Jeonghun Baek and Seong Joon Oh and Seonghyeon Kim and Hwalsuk Lee},
journal= {arXiv preprint arXiv:1910.04396},
year = {2019}
}