中文

CT-Net:基于轮廓Transformer的任意形状文本检测

计算机视觉与模式识别 2023-07-26 v1

摘要

基于轮廓的场景文本检测方法近年来发展迅速,但仍受限于不准确的前端轮廓初始化、多阶段误差累积或局部信息聚合不足。为应对这些局限,我们提出了一种名为CT-Net的新型任意形状场景文本检测框架,通过轮廓Transformer进行渐进式轮廓回归。具体而言,我们首先采用轮廓初始化模块生成粗文本轮廓,无需任何后处理。然后,我们采用轮廓细化模块以迭代方式自适应地细化文本轮廓,这有助于上下文信息捕获和渐进式全局轮廓形变。此外,我们提出一种自适应训练策略,使轮廓Transformer能够学习更多潜在形变路径,并引入重打分机制以有效抑制误检。在四个具有挑战性的数据集上进行了大量实验,证明了我们的CT-Net相比最先进方法的准确性和高效性。特别地,CT-Net在CTW1500和Total-Text数据集上分别以11.2帧每秒(FPS)取得86.1的F值(F-measure)和以10.1 FPS取得87.8的F值。

关键词

引用

@article{arxiv.2307.13310,
  title  = {CT-Net: Arbitrary-Shaped Text Detection via Contour Transformer},
  author = {Zhiwen Shao and Yuchen Su and Yong Zhou and Fanrong Meng and Hancheng Zhu and Bing Liu and Rui Yao},
  journal= {arXiv preprint arXiv:2307.13310},
  year   = {2023}
}

备注

This paper has been accepted by IEEE Transactions on Circuits and Systems for Video Technology