ESTextSpotter:基于Transformer显式协同的场景文本 spotting 方法
计算机视觉与模式识别
2023-08-22 v1
摘要
近年来,端到端场景文本 spotting 方法正演进至基于Transformer的框架。尽管先前研究已表明文本检测与识别间内在协同的关键重要性,但基于Transformer方法的最新进展通常采用共享查询的隐式协同策略,无法充分释放这两个交互任务的潜力。本文认为,考虑文本检测与识别不同特性的显式协同可显著提升文本 spotting 性能。为此,我们提出一种名为基于显式协同的文本 spotting Transformer框架(ESTextSpotter)的新模型,其通过在单一解码器内为文本检测与识别建模判别性与交互性特征来实现显式协同。具体而言,我们将传统共享查询分解为面向文本多边形与内容的任务感知查询;借助所提视觉-语言通信模块的解码器,查询以显式方式相互交互,同时保留文本检测与识别的判别模式,从而显著提升性能。此外,我们提出任务感知查询初始化方案以确保训练稳定。实验结果表明,我们的模型显著优于先前最先进(SOTA)方法。代码见 https://github.com/mxin262/ESTextSpotter。
引用
@article{arxiv.2308.10147,
title = {ESTextSpotter: Towards Better Scene Text Spotting with Explicit Synergy in Transformer},
author = {Mingxin Huang and Jiaxin Zhang and Dezhi Peng and Hao Lu and Can Huang and Yuliang Liu and Xiang Bai and Lianwen Jin},
journal= {arXiv preprint arXiv:2308.10147},
year = {2023}
}
备注
Accepted to ICCV 2023