中文

TextNet:基于端到端可训练网络的图像不规则文本读取

计算机视觉与模式识别 2018-12-27 v1 多媒体

摘要

由于多方向、透视畸变尤其是不规则文本的弯曲特性,从图像中读取文本仍然具有挑战性。现有大多数方法尝试以两阶段或多阶段解决问题,这被认为是优化整体性能的瓶颈。为此,我们提出了一种名为 TextNet 的端到端可训练网络架构,能够同时从图像中定位并识别不规则文本。具体而言,我们开发了尺度感知注意力机制以学习多尺度图像特征作为骨干网络,为定位和识别共享全卷积特征与计算。在文本检测分支中,我们直接生成四边形文本提议,覆盖定向、透视和弯曲文本区域。为保留用于识别的文本特征,我们引入了透视 RoI 变换层,可将四边形提议对齐为小特征图。此外,为提取用于识别的有效特征,我们提出通过 RNN 将对齐的 RoI 特征编码为上下文信息,结合空间注意力机制生成文本序列。该整体流程能够处理规则与不规则情形。最后,文本定位与识别任务可通过设计的多任务损失以端到端方式联合训练。在标准基准上的实验表明,所提出的 TextNet 能够达到最先进的性能,并在不规则数据集上大幅优于现有方法。

关键词

引用

@article{arxiv.1812.09900,
  title  = {TextNet: Irregular Text Reading from Images with an End-to-End Trainable Network},
  author = {Yipeng Sun and Chengquan Zhang and Zuming Huang and Jiaming Liu and Junyu Han and Errui Ding},
  journal= {arXiv preprint arXiv:1812.09900},
  year   = {2018}
}

备注

Asian conference on computer vision, 2018, oral presentation