中文

SPTS v2:单点场景文本 spotting

计算机视觉与模式识别 2023-09-06 v4 人工智能

摘要

端到端场景文本 spotting 因其文本检测与识别之间的内在协同已取得显著进展。先前方法通常将以水平矩形、旋转矩形、四边形与多边形等人工标注作为前提,其代价远高于使用单点标注。我们的新框架 SPTS v2 允许我们使用单点标注训练高性能文本 spotting 模型。SPTS v2 保留了自回归 Transformer 配合实例分配解码器(IAD)的优势,通过在同一预测序列中顺序预测所有文本实例的中心点,同时采用并行识别解码器(PRD)并行进行文本识别,显著降低了序列长度的要求。这两个解码器共享相同参数,并通过一个简单而有效的信息传输过程交互连接以传递梯度与信息。在多个现有基准数据集上的综合实验表明,SPTS v2 能以更少参数超越先前最优的单点文本 spotter,同时实现 19×\times 更快的推理速度。在 SPTS v2 框架内,我们的实验表明与其他表示相比,场景文本 spotting 中可能存在对单点表示的偏好。这一尝试为超越现有范式领域的场景文本 spotting 应用提供了重要机遇。代码见:https://github.com/Yuliang-Liu/SPTSv2。

关键词

引用

@article{arxiv.2301.01635,
  title  = {SPTS v2: Single-Point Scene Text Spotting},
  author = {Yuliang Liu and Jiaxin Zhang and Dezhi Peng and Mingxin Huang and Xinyu Wang and Jingqun Tang and Can Huang and Dahua Lin and Chunhua Shen and Xiang Bai and Lianwen Jin},
  journal= {arXiv preprint arXiv:2301.01635},
  year   = {2023}
}

备注

Accepted for publication in TPAMI 2023. arXiv admin note: text overlap with arXiv:2112.07917