深度匹配先验网络:面向更紧凑的多方向文本检测
计算机视觉与模式识别
2017-03-07 v1
摘要
由于多方向、透视畸变以及文本大小、颜色和尺度的变化,检测偶然场景文本是一项具有挑战性的任务。回顾性研究仅侧重于使用矩形边界框或水平滑动窗口来定位文本,这可能导致冗余的背景噪声、不必要的重叠甚至信息丢失。为了解决这些问题,我们提出了一种基于卷积神经网络的新方法,称为深度匹配先验网络,以使用更紧凑的四边形来检测文本。首先,我们在几个特定的中间卷积层中使用四边形滑动窗口,以粗略召回具有更高重叠面积的文本,然后提出了一种共享的蒙特卡洛方法用于快速准确地计算多边形面积。之后,我们设计了一种用于相对回归的顺序协议,可以精确预测具有紧凑四边形的文本。此外,还提出了一种辅助平滑 Ln 损失用于进一步回归文本的位置,在鲁棒性和稳定性方面,其整体性能优于 L2 损失和平滑 L1 损失。我们的方法的有效性在公开的词级多方向场景文本数据库 ICDAR 2015 Robust Reading Competition Challenge 4“Incidental scene text localization”上进行了评估。我们方法的性能通过 F-measure 评估,达到 70.64%,优于 F-measure 为 63.76% 的现有 SOTA 方法。
引用
@article{arxiv.1703.01425,
title = {Deep Matching Prior Network: Toward Tighter Multi-oriented Text Detection},
author = {Yuliang Liu and Lianwen Jin},
journal= {arXiv preprint arXiv:1703.01425},
year = {2017}
}
备注
8 Pages, 7 figures. Accepted to appear in CVPR 2017