中文

DPTNet: 一种用于场景文本检测的双路径 Transformer 架构

计算机视觉与模式识别 2022-08-23 v1

摘要

深度学习的兴盛推动了场景文本检测的快速发展。在所有基于卷积网络的方法中,基于分割的方法因在检测任意形状与极端长宽比文本实例上的优势而受到广泛关注。然而,自底向上方法受限于其分割模型的性能。本文中,我们提出 DPTNet(双路径 Transformer 网络),一种简洁而高效的架构,用于为场景文本检测任务建模全局与局部信息。我们进一步提出一种并行设计,将卷积网络与强大的自注意力机制相整合,以在注意力路径与卷积路径间提供互补线索。此外,开发了跨双路径的双向交互模块,以在通道与空间维度上提供互补线索。我们还通过添加额外的多头注意力层来改进集中操作。我们的 DPTNet 在 MSRA-TD500 数据集上取得了最先进的结果,并在其他标准基准上于检测精度与速度方面提供了具竞争力的结果。

关键词

引用

@article{arxiv.2208.09878,
  title  = {DPTNet: A Dual-Path Transformer Architecture for Scene Text Detection},
  author = {Jingyu Lin and Jie Jiang and Yan Yan and Chunchao Guo and Hongfa Wang and Wei Liu and Hanzi Wang},
  journal= {arXiv preprint arXiv:2208.09878},
  year   = {2022}
}