DeepSolo++:让 Transformer 解码器以显式点 solo 完成多语言文本 spotting
计算机视觉与模式识别
2024-03-19 v2
摘要
端到端文本spotting旨在将场景文本检测与识别集成到统一框架中。处理两个子任务之间的关系在设计有效spotter时起着关键作用。尽管基于Transformer的方法消除了启发式后处理,但仍受困于子任务间的协同问题及低训练效率。此外,它们忽视了对多语言文本spotting的探索,而后者需要额外的文字系统识别任务。本文中,我们提出DeepSolo++,一种类DETR的简单基线,让单一解码器以显式点solo同时完成文本检测、识别和文字系统识别。技术上,对于每个文本实例,我们将字符序列表示为有序点,并用可学习的显式点查询建模。经过单一解码器后,点查询已编码必要的文本语义与位置,从而可通过非常简单的预测头并行解码为中心线、边界、文字系统和文本置信度。此外,我们展示了方法在字符类、语言类型和任务上令人惊讶的良好可扩展性。一方面,我们的方法不仅在英文场景中表现良好,也掌握了具有复杂字体结构和千级字符类(如中文)的转写。另一方面,与先前方法相比,我们的DeepSolo++以更简单的训练流程在额外引入的文字系统识别任务上取得了更好性能。另外,我们的模型也兼容行标注,其标注成本远少于多边形。代码见\url{https://github.com/ViTAE-Transformer/DeepSolo}。
引用
@article{arxiv.2305.19957,
title = {DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting},
author = {Maoyuan Ye and Jing Zhang and Shanshan Zhao and Juhua Liu and Tongliang Liu and Bo Du and Dacheng Tao},
journal= {arXiv preprint arXiv:2305.19957},
year = {2024}
}
备注
The extension of the CVPR 2023 paper (DeepSolo: Let Transformer Decoder with Explicit Points Solo for Text Spotting). arXiv admin note: substantial text overlap with arXiv:2211.10772