中文

探索更快的局部化学习用于场景文本检测

计算机视觉与模式识别 2022-07-05 v1

摘要

通常,基于深度网络获得高性能文本检测器需要进行预训练和长时间训练计算。本文提出一种新的场景文本检测网络(称为FANet),具有快速收敛速度和准确的文本定位。所提出的FANet是一种基于transformer特征学习和归一化傅里叶描述子建模的端到端文本检测器,其中设计了傅里叶描述子提议网络和迭代文本解码网络以高效且准确地识别文本提议。此外,还提出了密集匹配策略和精心设计的损失函数用于优化网络性能。大量实验表明,所提出的FANet可用更少的训练轮次且无需预训练达到SOTA性能。当我们引入额外数据进行预训练时,所提出的FANet可在MSRATD500、CTW1500和TotalText上达到SOTA性能。消融实验也验证了我们所做贡献的有效性。

关键词

引用

@article{arxiv.2207.01342,
  title  = {Explore Faster Localization Learning For Scene Text Detection},
  author = {Yuzhong Zhao and Yuanqiang Cai and Weijia Wu and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2207.01342},
  year   = {2022}
}