Pixel-Anchor:一种结合网络的快速有向场景文本检测器
计算机视觉与模式识别
2018-11-20 v1
摘要
近来,语义分割与通用目标检测框架已被广泛采用于场景文本检测任务。然而,二者单独使用在实践中均有明显缺陷。本文中,我们提出一种新颖的端到端可训练深度神经网络框架,名为 Pixel-Anchor,其通过特征共享与锚级注意力机制将语义分割与 SSD 结合于同一网络中,以检测有向场景文本。为处理尺寸与长宽比差异巨大的场景文本,我们在语义分割部分将 FPN 与 ASPP 操作结合作为编解码结构,并在 SSD 中提出一种新颖的自适应预测层。Pixel-Anchor 在单次网络前向传播中检测场景文本,除高效的融合非极大值抑制外不涉及复杂后处理。我们在公开数据集上对所提 Pixel-Anchor 进行了基准测试。Pixel-Anchor 在文本定位精度与运行速度上均优于对比方法,更具体地,在 ICDAR 2015 数据集上,所提算法对 960 x 1728 分辨率图像以 10 FPS 取得 0.8768 的 F-score。
引用
@article{arxiv.1811.07432,
title = {Pixel-Anchor: A Fast Oriented Scene Text Detector with Combined Networks},
author = {Yuan Li and Yuanjie Yu and Zefeng Li and Yangkun Lin and Meifang Xu and Jiwei Li and Xi Zhou},
journal= {arXiv preprint arXiv:1811.07432},
year = {2018}
}
备注
10 pages, 11 figures, 3 tables