一切关乎尺度——基于自适应缩放的高效文本检测
计算机视觉与模式识别
2019-07-30 v1
摘要
“文本可出现在任意位置”。这一特性要求我们仔细处理图像中所有像素以准确定位全部文本实例。特别是对于定位小文本区域这一更困难的任务,许多方法使用放大图像甚至多个重缩放图像作为输入。这显著增加了整图处理时间并无谓地放大了背景区域。若我们能获得先验信息告知文本实例在图中的粗略位置及其近似尺度,便可自适应选择处理哪些区域及如何重缩放,从而大幅减少处理时间。为估计该先验,我们提出一种基于分割的网络,带有额外的“尺度预测器”——一个预测各文本段尺度的输出通道。该网络应用于下采样图像,以高效逼近所需先验,而无需处理原图所有像素。近似先验随后用于创建仅含文本区域、重缩放至规范尺度的紧凑图像,并再次输入分割网络进行细粒度检测。我们表明该方法为固定缩放方案提供了有力替代,在处理远少像素的同时达到与更大输入尺度相当的精度。在ICDAR15与ICDAR17 MLT基准上的定性与定量结果验证了我们的方法。
引用
@article{arxiv.1907.12122,
title = {It's All About The Scale -- Efficient Text Detection Using Adaptive Scaling},
author = {Elad Richardson and Yaniv Azar and Or Avioz and Niv Geron and Tomer Ronen and Zach Avraham and Stav Shapiro},
journal= {arXiv preprint arXiv:1907.12122},
year = {2019}
}