用于精确场景文本检测的几何归一化网络
计算机视觉与模式识别
2019-09-04 v1
摘要
大几何(如方向)方差是场景文本检测中的关键挑战。本工作中,我们首先通过实验探究网络在学习场景文本几何方差上的能力,发现网络仅能处理有限的文本几何方差。随后,我们提出一种新颖的几何归一化模块(Geometry Normalization Module, GNM),其具有多个分支,每个分支由一个尺度归一化单元与一个方向归一化单元组成,以通过至少一个分支将每个文本实例归一化至期望的规范几何范围。该 GNM 具有通用性,可便捷插入现有基于卷积神经网络的文本检测器以构建端到端的几何归一化网络(Geometry Normalization Networks, GNNets)。此外,我们提出一种几何感知训练方案,通过从均匀几何方差分布中采样与增广文本实例来有效训练 GNNets。最后,在 ICDAR 2015 与 ICDAR 2017 MLT 等流行基准上的实验验证,我们的方法以一次性前向测试 F 值分别达到 88.52 与 74.54,显著优于所有最先进方法。
引用
@article{arxiv.1909.00794,
title = {Geometry Normalization Networks for Accurate Scene Text Detection},
author = {Youjiang Xu and Jiaqi Duan and Zhanghui Kuang and Xiaoyu Yue and Hongbin Sun and Yue Guan and Wayne Zhang},
journal= {arXiv preprint arXiv:1909.00794},
year = {2019}
}
备注
ICCV 2019