PGNet:基于点聚集网络的实时任意形状文本 spotting
计算机视觉与模式识别
2021-04-13 v1
摘要
任意形状文本的读取已受到越来越多的研究关注。然而,现有的文本 spotter 大多构建于两阶段框架或基于字符的方法上,它们受限于非极大值抑制(NMS)、感兴趣区域(RoI)操作或字符级标注。本文中,为解决上述问题,我们提出一种新颖的全卷积点聚集网络(PGNet)用于实时读取任意形状文本。PGNet 是一种单阶段文本 spotter,其中像素级字符分类图通过所提出的 PG-CTC 损失学习,避免了字符级标注的使用。借助 PG-CTC 解码器,我们从二维空间聚集高层字符分类向量并将其解码为文本符号,无需涉及 NMS 与 RoI 操作,从而保证了高效率。此外,通过推理每个字符与其邻域的关系,提出图精炼模块(GRM)以优化粗识别并提升端到端性能。实验证明,所提方法取得了具有竞争力的准确率,同时显著提升了运行速度。特别是在 Total-Text 上,其以 46.7 FPS 运行,大幅超越此前的 spotter。
引用
@article{arxiv.2104.05458,
title = {PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network},
author = {Pengfei Wang and Chengquan Zhang and Fei Qi and Shanshan Liu and Xiaoqiang Zhang and Pengyuan Lyu and Junyu Han and Jingtuo Liu and Errui Ding and Guangming Shi},
journal= {arXiv preprint arXiv:2104.05458},
year = {2021}
}
备注
10 pages, 8 figures, AAAI 2021