文本 spotting Transformers
计算机视觉与模式识别
2022-04-06 v1
摘要
本文提出 TExt Spotting TRansformers(TESTR),一种利用 Transformers 进行自然场景文本检测与识别的通用端到端文本 spotting 框架。TESTR 构建于单一编码器与双解码器之上,用于联合文本框控制点回归与字符识别。与多数现有文献不同,我们的方法无需感兴趣区域(Region-of-Interest)操作与启发式驱动的后处理流程;TESTR 在处理弯曲文本框时尤为有效,而传统边界框表示的适配对此需特别考量。我们展示了适用于贝塞尔曲线与多边形标注下文本实例的控制点规范表示。此外,我们设计了一种边界框引导的多边形检测(box-to-polygon)过程。在弯曲与任意形状数据集上的实验证明了所提 TESTR 算法的当前最优性能。
引用
@article{arxiv.2204.01918,
title = {Text Spotting Transformers},
author = {Xiang Zhang and Yongwen Su and Subarna Tripathi and Zhuowen Tu},
journal= {arXiv preprint arXiv:2204.01918},
year = {2022}
}
备注
Accepted to CVPR 2022