利用引导 CNN 提升场景文本检测器
计算机视觉与模式识别
2018-05-15 v2 机器学习
摘要
深度 CNN 在文本检测中取得了巨大成功。现有多数方法试图通过精巧的网络设计提高精度,却较少关注速度。本文提出一种称为引导 CNN 的通用文本检测框架,以同时实现这两个目标。所提模型由一个引导子网络和一个主文本检测器组成:引导子网络从输入图像自身学习引导掩码,主文本检测器的每一次卷积与非线性操作仅在引导掩码内进行。一方面,引导子网络粗略滤除非文本区域,大幅降低计算复杂度;另一方面,主文本检测器专注于区分文本与困难非文本区域并回归文本边界框,获得更好的检测精度。我们提出一种称为背景感知分块随机合成的的训练策略以进一步提升性能。我们以 CTPN 和 EAST 两种最先进方法为骨干网络,证明了所提引导 CNN 不仅有效而且高效。在具有挑战性的基准 ICDAR 2013 上,它使 CTPN 平均加速 2.9 倍,同时将 F-measure 提高 1.5%。在 ICDAR 2015 上,它使 EAST 加速 2.0 倍,同时将 F-measure 提高 1.0%。
引用
@article{arxiv.1805.04132,
title = {Boosting up Scene Text Detectors with Guided CNN},
author = {Xiaoyu Yue and Zhanghui Kuang and Zhaoyang Zhang and Zhenfang Chen and Pan He and Yu Qiao and Wei Zhang},
journal= {arXiv preprint arXiv:1805.04132},
year = {2018}
}
备注
Submitted to British Machine Vision Conference (BMVC), 2018