利用级联卷积文本网络的自然图像准确文本定位
计算机视觉与模式识别
2016-04-01 v1
摘要
我们引入了一种用于场景文本检测的新型自顶向下流程。我们提出了一种新颖的级联卷积文本网络(Cascaded Convolutional Text Network, CCTN),其联合两个定制的卷积网络以实现由粗到精的文本定位。CCTN从低分辨率图像中快速粗略检测文本区域,然后从每个放大的区域中准确局部化文本行。我们将先前基于字符的检测转化为直接的文本区域估计,避免了多个自底向上的后处理步骤。通过将整个文本区域视为提供强语义信息的检测对象,它展现出惊人的鲁棒性和判别力。我们通过开发矩形卷积和多次网络内融合来定制卷积网络。这使其能高效处理多形状和多尺度文本。此外,CCTN通过共享卷积计算而计算高效,且其高层特性使其对多种语言和多个方向保持不变性。它在ICDAR 2011和ICDAR 2013上取得了0.84和0.86的F值,相较最先进结果[23, 1]有实质性提升。
引用
@article{arxiv.1603.09423,
title = {Accurate Text Localization in Natural Image with Cascaded Convolutional Text Network},
author = {Tong He and Weilin Huang and Yu Qiao and Jian Yao},
journal= {arXiv preprint arXiv:1603.09423},
year = {2016}
}