中文

DNTextSpotter:通过改进去噪训练实现任意形状场景文本检测

计算机视觉与模式识别 2025-06-03 v4 人工智能

摘要

越来越多基于Transformer架构的端到端文本检测方法显示出优异性能。这些方法利用二分图匹配算法执行预测对象与实际对象之间的一对一最佳匹配。然而,二分图匹配的不稳定性会导致优化目标不一致,从而影响模型训练性能。现有文献通过应用去噪训练来解决二分图匹配在目标检测任务中的不稳定性问题。不幸的是,这种去噪训练方法无法直接应用于文本检测任务,因为这些任务需要执行不规则形状检测任务和比分类更复杂的文本识别任务。为此,我们提出一种用于任意形状文本检测的新型去噪训练方法(DNTextSpotter)。具体而言,我们将去噪部分的查询分解为无噪位置查询和无噪内容查询。我们使用Bezier中心曲线的四个控制点生成无噪位置查询。对于无噪内容查询,鉴于文本在固定位置顺序输出不利于将位置与内容对齐,我们采用掩码字符滑动方法初始化无噪内容查询,从而帮助文本内容与位置对齐。为提高模型对背景的感知能力,我们进一步利用额外的损失函数用于去噪训练部分的背景字符分类。尽管DNTextSpotter概念简单,但它在四个基准数据集上超越了最先进的方法(Total-Text、SCUT-CTW1500、ICDAR15和Inverse-Text),尤其在Inverse-Text数据集上比最佳方法提高了11.3%。

关键词

引用

@article{arxiv.2408.00355,
  title  = {DNTextSpotter: Arbitrary-Shaped Scene Text Spotting via Improved Denoising Training},
  author = {Yu Xie and Qian Qiao and Jun Gao and Tianxiang Wu and Jiaqing Fan and Yue Zhang and Jielei Zhang and Huyang Sun},
  journal= {arXiv preprint arXiv:2408.00355},
  year   = {2025}
}

备注

Accepted by ACM'MM2024