Mask TextSpotter:一种用于检测任意形状文本的端到端可训练神经网络
计算机视觉与模式识别
2019-08-23 v1
摘要
将文本检测与文本识别统一为端到端的训练方式,已成为自然场景文本阅读的新趋势,因为这两项任务高度相关且互为补充。本文研究了场景文本定位问题,该问题旨在同时进行自然图像中的文本检测与识别。我们提出了一种名为 Mask TextSpotter 的端到端可训练神经网络。与以往遵循“候选区域生成网络加序列到序列识别网络”流程的文本定位器不同,Mask TextSpotter 具有简单流畅的端到端学习过程,其中检测和识别均可通过语义分割直接从二维空间实现。此外,我们还提出了一个空间注意力模块以提升性能和通用性。得益于所提出的二维表示方法在检测和识别上的应用,它能够轻松处理不规则形状的文本实例,例如弯曲文本。我们在四个英文数据集和一个多语言数据集上对其进行了评估,在检测和端到端文本识别任务中均取得了优于现有最佳方法的一致性能。此外,我们进一步单独研究了本方法的识别模块,该模块在场景文本识别的常规和非常规文本数据集上均显著优于现有最佳方法。
引用
@article{arxiv.1908.08207,
title = {Mask TextSpotter: An End-to-End Trainable Neural Network for Spotting Text with Arbitrary Shapes},
author = {Minghui Liao and Pengyuan Lyu and Minghang He and Cong Yao and Wenhao Wu and Xiang Bai},
journal= {arXiv preprint arXiv:1908.08207},
year = {2019}
}
备注
Accepted by TPAMI. An extension of the conference version. arXiv admin note: text overlap with arXiv:1807.02242