一种具有显式对齐与注意力的端到端 TextSpotter
计算机视觉与模式识别
2018-03-26 v3
摘要
自然图像中的文本检测与识别长期被视为两个按顺序处理的独立任务。由于优化难度的显著差异,在统一框架中训练这两个任务并非易事。在本工作中,我们提出一个概念简单却高效的框架,可一次性同时处理这两项任务。我们的主要贡献有三方面:1) 提出一种新颖的文本对齐层,能够精确计算任意方向文本实例的卷积特征,这是提升性能的关键;2) 引入字符注意力机制,利用字符空间信息作为显式监督,大幅改进识别效果;3) 将两项技术连同用于词识别的新 RNN 分支无缝集成到单一模型中,该模型可端到端训练。这使得两个任务通过共享卷积特征协同工作,对识别具有挑战性的文本实例至关重要。我们的模型在 ICDAR2015 数据集的端到端识别上取得了令人印象深刻的成果,显著推进了近期最好结果,在使用强、弱和通用词典时 F-measure 分别从 (0.54, 0.51, 0.47) 提升至 (0.82, 0.77, 0.63)。得益于联合训练,我们的方法也可作为优秀的检测器,在两个数据集上取得新的最优检测性能。
引用
@article{arxiv.1803.03474,
title = {An end-to-end TextSpotter with Explicit Alignment and Attention},
author = {Tong He and Zhi Tian and Weilin Huang and Chunhua Shen and Yu Qiao and Changming Sun},
journal= {arXiv preprint arXiv:1803.03474},
year = {2018}
}
备注
Accepted to IEEE Conf. Computer Vision and Pattern Recognition (CVPR) 2018. Code is available at: https://github.com/tonghe90/textspotter