中文

基于上下文注意力多任务学习的单阶段任意形状文本检测器

计算机视觉与模式识别 2019-08-16 v1

摘要

检测任意形状的场景文本在过去几年中一直是一项具有挑战性的任务。本文提出一种新颖的基于分割的文本检测器,即 SAST,其采用基于全卷积网络(FCN)的上下文注意力多任务学习框架,学习多种几何属性以重建文本区域的多边形表示。考虑到文本的序列特征,引入上下文注意力块(Context Attention Block)来捕获像素信息的长程依赖,从而获得更可靠的分割。在后处理中,提出一种点至四边形(Point-to-Quad)分配方法,通过单阶段集成高层目标知识与低层像素信息将像素聚类为文本实例。此外,利用所提出的几何属性可更有效地提取任意形状文本的多边形表示。在包括 ICDAR2015、ICDAR2017-MLT、SCUT-CTW1500 和 Total-Text 在内的多个基准上的实验表明,SAST 在精度上取得了更优或可比的性能。此外,所提算法在单块 NVIDIA Titan Xp 显卡上于 SCUT-CTW1500 上以 27.63 FPS 运行,Hmean 达 81.0%,超越了大多数现有的基于分割的方法。

关键词

引用

@article{arxiv.1908.05498,
  title  = {A Single-Shot Arbitrarily-Shaped Text Detector based on Context Attended Multi-Task Learning},
  author = {Pengfei Wang and Chengquan Zhang and Fei Qi and Zuming Huang and Mengyi En and Junyu Han and Jingtuo Liu and Errui Ding and Guangming Shi},
  journal= {arXiv preprint arXiv:1908.05498},
  year   = {2019}
}

备注

9 pages, 6 figures, 7 tables, To appear in ACM Multimedia 2019