中文

基于像素聚合网络的高效准确任意形状文本检测

计算机视觉与模式识别 2020-08-04 v2

摘要

场景文本检测是场景文本阅读系统的重要步骤,随着卷积神经网络的发展取得了快速进展。然而,两个主要挑战仍然存在,阻碍了其向实际应用的部署。第一个问题是速度与精度之间的权衡。第二个问题是对任意形状文本实例的建模。近来,已有一些方法被提出以应对任意形状文本检测,但它们很少考虑整个流程的速度,这可能在实用中有所欠缺。在本文中,我们提出了一种高效且准确的任意形状文本检测器,称为像素聚合网络(PAN),其配备了一个低计算成本的分割头和一个可学习的后处理。更具体地,分割头由特征金字塔增强模块(FPEM)和特征融合模块(FFM)组成。FPEM 是一个可级联的 U 形模块,可引入多级信息以引导更好的分割。FFM 能将不同深度的 FPEM 给出的特征汇聚为用于分割的最终特征。可学习的后处理由像素聚合(PA)实现,其可通过预测的相似度向量精确聚合文本像素。在多个标准基准上的实验验证了所提 PAN 的优越性。值得注意的是,我们的方法在 CTW1500 上以 84.2 FPS 取得了 79.9% 的竞争性 F 值。

关键词

引用

@article{arxiv.1908.05900,
  title  = {Efficient and Accurate Arbitrary-Shaped Text Detection with Pixel Aggregation Network},
  author = {Wenhai Wang and Enze Xie and Xiaoge Song and Yuhang Zang and Wenjia Wang and Tong Lu and Gang Yu and Chunhua Shen},
  journal= {arXiv preprint arXiv:1908.05900},
  year   = {2020}
}

备注

Accept by ICCV 2019