中文

SPTS:单点文本 spotting

计算机视觉与模式识别 2022-08-30 v6

摘要

现有场景文本 spotting(即端到端文本检测与识别)方法依赖于昂贵的边界框标注(例如文本行、词级或字符级边界框)。我们首次证明,训练场景文本 spotting 模型可通过为每个实例提供极低成本的单点标注来实现。我们提出一种端到端场景文本 spotting 方法,将场景文本 spotting 作为序列预测任务来处理。给定图像作为输入,我们将所需的检测与识别结果表示为离散 token 的序列,并使用自回归 Transformer 预测该序列。所提方法简洁而有效,能在广泛使用的基准上取得最先进结果。最为重要的是,我们表明性能对点标注的位置并不十分敏感,这意味着其比需要精确位置的边界框更易标注甚至可自动生成。我们相信,这一开创性尝试表明了场景文本 spotting 应用规模远超以往可能的重大机遇。代码见 https://github.com/shannanyinxiang/SPTS。

关键词

引用

@article{arxiv.2112.07917,
  title  = {SPTS: Single-Point Text Spotting},
  author = {Dezhi Peng and Xinyu Wang and Yuliang Liu and Jiaxin Zhang and Mingxin Huang and Songxuan Lai and Shenggao Zhu and Jing Li and Dahua Lin and Chunhua Shen and Xiang Bai and Lianwen Jin},
  journal= {arXiv preprint arXiv:2112.07917},
  year   = {2022}
}

备注

Accepted by ACM MM 2022