中文

DeepSolo:让带显式点的 Transformer 解码器独立完成文本 spotting

计算机视觉与模式识别 2023-03-16 v4

摘要

端到端文本 spotting 旨在将场景文本检测与识别集成到统一框架中。处理两个子任务之间的关系在设计有效 spotter 时起着关键作用。尽管基于 Transformer 的方法消除了启发式后处理,但它们仍受子任务间协同问题及低训练效率的困扰。本文中,我们提出 DeepSolo,一个类 DETR 的简单基线,让单一解码器借助显式点 Solo 同时完成文本检测与识别。技术上,对每个文本实例,我们将字符序列表示为有序点,并用可学习的显式点查询对其建模。经过单一解码器后,点查询已编码必要的文本语义与位置,从而可通过非常简单的预测头并行进一步解码为文本的中心线、边界、文字体系与置信度。此外,我们还引入了文本匹配准则以提供更准确的监督信号,从而实现更高效的训练。在公开基准上的定量实验表明,DeepSolo 优于先前最先进的方法并取得了更好的训练效率。另外,DeepSolo 也兼容行标注,其标注成本远低于多边形。代码见 https://github.com/ViTAE-Transformer/DeepSolo。

关键词

引用

@article{arxiv.2211.10772,
  title  = {DeepSolo: Let Transformer Decoder with Explicit Points Solo for Text Spotting},
  author = {Maoyuan Ye and Jing Zhang and Shanshan Zhao and Juhua Liu and Tongliang Liu and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2211.10772},
  year   = {2023}
}

备注

CVPR 2023