中文

MixNet:面向自然场景中困难文本的准确检测

计算机视觉与模式识别 2023-08-30 v2

摘要

在真实场景中检测小型场景文本实例尤其具有挑战性,其中不规则位置与非理想光照的影响常导致检测错误。我们提出 MixNet,一种结合 CNN 与 Transformers 优势的混合架构,能够准确检测来自困难自然场景的小型文本,而不受其方向、风格与光照条件影响。MixNet 包含两个关键模块:(1)作为骨干网络的特性洗牌网络(FSNet);(2)利用场景文本一维流形约束的中心 Transformer 块(CTBlock)。我们首先在 FSNet 中引入一种新颖的特征洗牌策略,以促进跨多尺度的特征交换,生成优于流行 ResNet 和 HRNet 的高分辨率特征。FSNet 骨干网络相较许多现有文本检测方法(包括 PAN、DB 和 FAST)取得了显著改进。随后我们设计了一个互补的 CTBlock,利用基于中心线的特征(类似于文本区域的中轴),并表明在小型场景文本紧密出现的困难情况下,其性能优于基于轮廓的方法。大量实验结果表明,将 FSNet 与 CTBlock 混合的 MixNet 在多个场景文本检测数据集上取得了最先进(SOTA)结果。

关键词

引用

@article{arxiv.2308.12817,
  title  = {MixNet: Toward Accurate Detection of Challenging Scene Text in the Wild},
  author = {Yu-Xiang Zeng and Jun-Wei Hsieh and Xin Li and Ming-Ching Chang},
  journal= {arXiv preprint arXiv:2308.12817},
  year   = {2023}
}