Mask TextSpotter v3:用于鲁棒场景文本检测的分割提议网络
计算机视觉与模式识别
2020-07-21 v1
摘要
近期,集成检测与识别的端到端可训练场景文本检测方法取得了显著进展。然而,当前大多数任意形状场景文本检测器使用区域提议网络(RPN)生成提议。RPN严重依赖人工设计的锚框,且其提议用轴对齐矩形表示。前者难以处理长宽比极端或不规则形状的文本实例,后者在密集定向文本情况下常将多个相邻实例纳入单个提议中。为解决这些问题,我们提出Mask TextSpotter v3,一种采用分割提议网络(SPN)替代RPN的端到端可训练场景文本检测器。我们的SPN无锚框,并能准确表示任意形状的提议。因此在检测极端长宽比或不规则形状文本实例方面优于RPN。此外,SPN生成的准确提议可使用掩码RoI特征来解耦相邻文本实例。因此,我们的Mask TextSpotter v3能处理极端长宽比或不规则形状的文本实例,且其识别精度不受邻近文本或背景噪声影响。具体而言,我们在Rotated ICDAR 2013数据集(旋转鲁棒性)上以21.9%的优势、在Total-Text数据集(形状鲁棒性)上以5.9%的优势超越最先进方法,并在MSRA-TD500数据集(长宽比鲁棒性)上取得最先进性能。代码见:https://github.com/MhLiao/MaskTextSpotterV3
引用
@article{arxiv.2007.09482,
title = {Mask TextSpotter v3: Segmentation Proposal Network for Robust Scene Text Spotting},
author = {Minghui Liao and Guan Pang and Jing Huang and Tal Hassner and Xiang Bai},
journal= {arXiv preprint arXiv:2007.09482},
year = {2020}
}
备注
Accepted by ECCV 2020