基于 Transformer 的任意形状文本检测
计算机视觉与模式识别
2022-02-24 v1 机器学习
摘要
近期的文本检测框架需要若干手工设计的组件,如锚框生成、非极大值抑制(NMS)或多阶段处理(例如标签生成),以检测任意形状的文本图像。相比之下,我们提出了一种基于 Detection using Transformers (DETR) 的端到端可训练架构,其在任意形状文本检测上优于先前的最先进方法。我们提出的方法核心在于利用一种边界框损失函数,能够准确度量任意检测文本区域在尺度和长宽比上的变化。这得益于由贝塞尔曲线构成的混合形状表示,该表示进一步被分割为分段多边形。所提出的损失函数由此定义为分段多边形上的广义分割交并比(generalized-split-intersection-over-union)损失与对贝塞尔曲线控制点施加的 Smooth- 回归正则项的组合。我们使用 Total-Text 和 CTW-1500 数据集评估弯曲文本、使用 MSRA-TD500 和 ICDAR15 数据集评估多方向文本的所提模型,并表明该方法在任意形状文本检测任务上优于先前的最先进方法。
引用
@article{arxiv.2202.11221,
title = {Arbitrary Shape Text Detection using Transformers},
author = {Zobeir Raisi and Georges Younes and John Zelek},
journal= {arXiv preprint arXiv:2202.11221},
year = {2022}
}