中文

PGNet:基于点聚集网络的实时任意形状文本 spotting

计算机视觉与模式识别 2021-04-13 v1

摘要

任意形状文本的读取已受到越来越多的研究关注。然而,现有的文本 spotter 大多构建于两阶段框架或基于字符的方法上,它们受限于非极大值抑制(NMS)、感兴趣区域(RoI)操作或字符级标注。本文中,为解决上述问题,我们提出一种新颖的全卷积点聚集网络(PGNet)用于实时读取任意形状文本。PGNet 是一种单阶段文本 spotter,其中像素级字符分类图通过所提出的 PG-CTC 损失学习,避免了字符级标注的使用。借助 PG-CTC 解码器,我们从二维空间聚集高层字符分类向量并将其解码为文本符号,无需涉及 NMS 与 RoI 操作,从而保证了高效率。此外,通过推理每个字符与其邻域的关系,提出图精炼模块(GRM)以优化粗识别并提升端到端性能。实验证明,所提方法取得了具有竞争力的准确率,同时显著提升了运行速度。特别是在 Total-Text 上,其以 46.7 FPS 运行,大幅超越此前的 spotter。

关键词

引用

@article{arxiv.2104.05458,
  title  = {PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network},
  author = {Pengfei Wang and Chengquan Zhang and Fei Qi and Shanshan Liu and Xiaoqiang Zhang and Pengyuan Lyu and Junyu Han and Jingtuo Liu and Errui Ding and Guangming Shi},
  journal= {arXiv preprint arXiv:2104.05458},
  year   = {2021}
}

备注

10 pages, 8 figures, AAAI 2021