中文

弥合端到端与两步文本检测之间的差距

计算机视觉与模式识别 2024-04-09 v1

摘要

模块化在复杂系统的开发和维护中起着至关重要的作用。虽然端到端文本检测有效缓解了传统两步方法中出现的误差累积和次优性能问题,但由于其卓越的模块化特性,两步方法在许多竞赛和实际场景中继续受到青睐。在本文中,我们引入了 Bridging Text Spotting,这是一种新颖的方法,解决了两步方法中的误差累积和次优性能问题,同时保留了模块化。为了实现这一点,我们采用了一个独立开发和训练的经过良好训练的检测器和识别器,然后锁定它们的参数以保留其已获得的能力。随后,我们引入了一个 Bridge,通过零初始化神经网络连接锁定的检测器和识别器。这个以权重为零初始化的零初始化神经网络,确保了检测中的大感受野特征无缝集成到锁定的识别器中。此外,由于固定的检测器和识别器无法自然地获得端到端优化特征,我们采用 Adapter 来促进它们对这些特征的高效学习。我们通过大量实验证明了所提出方法的有效性:通过 Bridging Text Spotting 连接最新的检测器和识别器,我们在 Total-Text 上达到了 83.3% 的准确率,在 CTW1500 上达到了 69.8%,在 ICDAR 2015 上达到了 89.5%。代码可在 https://github.com/mxin262/Bridging-Text-Spotting 获取。

关键词

引用

@article{arxiv.2404.04624,
  title  = {Bridging the Gap Between End-to-End and Two-Step Text Spotting},
  author = {Mingxin Huang and Hongliang Li and Yuliang Liu and Xiang Bai and Lianwen Jin},
  journal= {arXiv preprint arXiv:2404.04624},
  year   = {2024}
}

备注

Accepted by CVPR2024