中文

MANGO:一种掩码注意力引导的单阶段场景文本识别器

计算机视觉与模式识别 2021-10-26 v2

摘要

近年来端到端场景文本识别因其在真实应用中的全局优化优势和高可维护性而成为热门研究方向。多数方法试图开发各种感兴趣区域(RoI)操作,将检测部分与序列识别部分拼接为两阶段文本识别框架。然而在此类框架中,识别部分对检测结果(如文本轮廓的紧凑性)高度敏感。为解决该问题,本文提出一种新颖的掩码注意力引导单阶段文本识别框架MANGO,可直接识别字符序列而无需RoI操作。具体地,设计位置感知掩码注意力模块以生成每个文本实例及其字符的注意力权重,使图像中不同文本实例被分配至不同特征图通道并进一步分组为一批实例特征。最后应用轻量序列解码器生成字符序列。值得注意的是,MANGO天然适应任意形状文本识别,且仅需粗粒度位置信息(如矩形边界框)和文本标注即可端到端训练。实验结果表明,所提方法在ICDAR 2013、ICDAR 2015、Total-Text和SCUT-CTW1500等规则与不规则文本识别基准上取得了具竞争力的甚至新的SOTA性能。

关键词

引用

@article{arxiv.2012.04350,
  title  = {MANGO: A Mask Attention Guided One-Stage Scene Text Spotter},
  author = {Liang Qiao and Ying Chen and Zhanzhan Cheng and Yunlu Xu and Yi Niu and Shiliang Pu and Fei Wu},
  journal= {arXiv preprint arXiv:2012.04350},
  year   = {2021}
}

备注

Accepted to AAAI2021. Code is available at https://davar-lab.github.io/publication.html or https://github.com/hikopensource/DAVAR-Lab-OCR