中文

DPText-DETR:基于 Transformer 中动态点实现更优场景文本检测

计算机视觉与模式识别 2022-11-29 v2

摘要

近来,基于 Transformer 的方法通过预测多边形点或贝塞尔曲线控制点来定位文本,在场景文本检测中颇为流行。然而,这些构建于检测 Transformer 框架之上的方法可能因粗糙的位置查询建模而取得次优的训练效率与性能。此外,先前工作所采用的点标签形式隐含了人类的阅读顺序,据我们观察,这阻碍了检测的鲁棒性。为应对这些挑战,本文提出一种简洁的动态点文本检测 Transformer 网络,称为 DPText-DETR。具体而言,DPText-DETR 直接利用显式点坐标生成位置查询,并以渐进方式动态更新它们。此外,为改善 Transformer 中非局部自注意力的空间归纳偏置,我们提出一种增强因子化自注意力模块,该模块为每个实例内的点查询提供圆形形状引导。进一步,我们设计了一种简单而有效的位置标签形式以解决先前形式的副作用。为更深入评估不同标签形式对真实场景检测鲁棒性的影响,我们建立了一个包含 500 张手动标注图像的 Inverse-Text 测试集。大量实验证明了我们的方法在流行基准上具有高训练效率、鲁棒性及最先进的性能。代码与 Inverse-Text 测试集可在 https://github.com/ymy-k/DPText-DETR 获取。

关键词

引用

@article{arxiv.2207.04491,
  title  = {DPText-DETR: Towards Better Scene Text Detection with Dynamic Points in Transformer},
  author = {Maoyuan Ye and Jing Zhang and Shanshan Zhao and Juhua Liu and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2207.04491},
  year   = {2022}
}

备注

Accepted to AAAI 2023