中文

基于 Transformer 的任意形状文本检测

计算机视觉与模式识别 2022-02-24 v1 机器学习

摘要

近期的文本检测框架需要若干手工设计的组件,如锚框生成、非极大值抑制(NMS)或多阶段处理(例如标签生成),以检测任意形状的文本图像。相比之下,我们提出了一种基于 Detection using Transformers (DETR) 的端到端可训练架构,其在任意形状文本检测上优于先前的最先进方法。我们提出的方法核心在于利用一种边界框损失函数,能够准确度量任意检测文本区域在尺度和长宽比上的变化。这得益于由贝塞尔曲线构成的混合形状表示,该表示进一步被分割为分段多边形。所提出的损失函数由此定义为分段多边形上的广义分割交并比(generalized-split-intersection-over-union)损失与对贝塞尔曲线控制点施加的 Smooth-ln\ln 回归正则项的组合。我们使用 Total-Text 和 CTW-1500 数据集评估弯曲文本、使用 MSRA-TD500 和 ICDAR15 数据集评估多方向文本的所提模型,并表明该方法在任意形状文本检测任务上优于先前的最先进方法。

关键词

引用

@article{arxiv.2202.11221,
  title  = {Arbitrary Shape Text Detection using Transformers},
  author = {Zobeir Raisi and Georges Younes and John Zelek},
  journal= {arXiv preprint arXiv:2202.11221},
  year   = {2022}
}