中文

STELA:一种具有学习锚框的实时场景文本检测器

计算机视觉与模式识别 2019-09-24 v2

摘要

为了实现对目标框的高覆盖率,传统基于单阶段锚框检测器的通常策略是在每个空间位置利用多个先验框,尤其在场景文本检测任务中。在本文中,我们提出一种简单直观的多方向文本检测方法,其中特征图的每个位置仅关联一个参考框。该想法受两阶段 R-CNN 框架启发,该框架可利用学习到的候选框估计任意形状物体的位置。我们方法的目标是将该机制整合进单阶段检测器,并采用通过回归操作获得的学习锚框来替换原始锚框以用于最终预测。基于 RetinaNet,我们的方法在多个公开基准上以完全实时的效率(800p 下 26.5fps)取得了有竞争力的性能,超越了所有基于锚框的场景文本检测器。此外,由于对锚框设计的关注较少,我们相信我们的方法易于应用于其他类似检测任务。代码将公开于 https://github.com/xhzdeng/stela。

关键词

引用

@article{arxiv.1909.07549,
  title  = {STELA: A Real-Time Scene Text Detector with Learned Anchor},
  author = {Linjie Deng and Yanxiang Gong and Xinchen Lu and Yi Lin and Zheng Ma and Mei Xie},
  journal= {arXiv preprint arXiv:1909.07549},
  year   = {2019}
}