中文

基于可微分二值化与自适应尺度融合的实时场景文本检测

计算机视觉与模式识别 2022-02-22 v1

摘要

近年来,基于分割的场景文本检测方法因其在检测任意形状和极端长宽比文本实例方面的优越性(得益于像素级描述)而在场景文本检测领域受到广泛关注。然而,现有绝大多数基于分割的方法受其复杂后处理算法及其分割模型的尺度鲁棒性限制,其中后处理算法不仅与模型优化相孤立而且耗时,而尺度鲁棒性通常通过直接融合多尺度特征图来增强。本文中,我们提出一种可微分二值化(DB)模块,将后处理流程中最重要步骤之一的二值化过程集成到分割网络中。与所提DB模块共同优化,分割网络可产生更准确的结果,从而以简单流程提升文本检测精度。此外,提出一种高效的自适应尺度融合(ASF)模块,通过自适应融合不同尺度特征来提升尺度鲁棒性。通过将所提DB与ASF结合到分割网络中,我们提出的场景文本检测器在五个标准基准上就检测精度与速度而言持续取得最先进结果。

关键词

引用

@article{arxiv.2202.10304,
  title  = {Real-Time Scene Text Detection with Differentiable Binarization and Adaptive Scale Fusion},
  author = {Minghui Liao and Zhisheng Zou and Zhaoyi Wan and Cong Yao and Xiang Bai},
  journal= {arXiv preprint arXiv:2202.10304},
  year   = {2022}
}

备注

Accepted by TPAMI. arXiv admin note: substantial text overlap with arXiv:1911.08947