DeepSolo:让带显式点的 Transformer 解码器独立完成文本 spotting
计算机视觉与模式识别
2023-03-16 v4
摘要
端到端文本 spotting 旨在将场景文本检测与识别集成到统一框架中。处理两个子任务之间的关系在设计有效 spotter 时起着关键作用。尽管基于 Transformer 的方法消除了启发式后处理,但它们仍受子任务间协同问题及低训练效率的困扰。本文中,我们提出 DeepSolo,一个类 DETR 的简单基线,让单一解码器借助显式点 Solo 同时完成文本检测与识别。技术上,对每个文本实例,我们将字符序列表示为有序点,并用可学习的显式点查询对其建模。经过单一解码器后,点查询已编码必要的文本语义与位置,从而可通过非常简单的预测头并行进一步解码为文本的中心线、边界、文字体系与置信度。此外,我们还引入了文本匹配准则以提供更准确的监督信号,从而实现更高效的训练。在公开基准上的定量实验表明,DeepSolo 优于先前最先进的方法并取得了更好的训练效率。另外,DeepSolo 也兼容行标注,其标注成本远低于多边形。代码见 https://github.com/ViTAE-Transformer/DeepSolo。
引用
@article{arxiv.2211.10772,
title = {DeepSolo: Let Transformer Decoder with Explicit Points Solo for Text Spotting},
author = {Maoyuan Ye and Jing Zhang and Shanshan Zhao and Juhua Liu and Tongliang Liu and Bo Du and Dacheng Tao},
journal= {arXiv preprint arXiv:2211.10772},
year = {2023}
}
备注
CVPR 2023