中文

面向任意形状文本检测的核心提议网络

计算机视觉与模式识别 2023-06-21 v2

摘要

基于分割的方法在任意形状文本检测中取得了巨大成功。然而,由于场景图像中文本的复杂性,分离相邻文本实例仍是最具挑战性的问题之一。本文中,我们提出了一种创新的核心提议网络(称为KPN)用于任意形状文本检测。所提KPN通过将不同文本分类为实例独立特征图来分离相邻文本实例,同时避免了基于分割的任意形状文本检测方法中的复杂聚合过程。具体而言,我们的KPN为每个文本图像预测一个高斯中心图,该图将用于根据其对应的关键点位置从嵌入特征图中提取一系列候选核心提议(即动态卷积核)。为增强核心提议间的独立性,我们通过正交约束提出了一种新颖的正交学习损失(OLL)。具体地,我们的核心提议包含网络学习到的重要自信息以及位置嵌入提供的位置信息。最后,核心提议将分别卷积所有嵌入特征图以生成文本实例的独立嵌入图。以此方式,我们的KPN能有效分离相邻文本实例并提升对不清晰边界的鲁棒性。据我们所知,我们的工作是首个引入动态卷积核策略以高效且有效地解决文本检测中相邻文本实例粘连问题的。在具有挑战性的数据集上的实验结果验证了我们所提方法的优异性能和效率。代码和模型可在 https://github.com/GXYM/KPN 获取。

关键词

引用

@article{arxiv.2203.06410,
  title  = {Kernel Proposal Network for Arbitrary Shape Text Detection},
  author = {Shi-Xue Zhang and Xiaobin Zhu and Jie-Bo Hou and Chun Yang and Xu-Cheng Yin},
  journal= {arXiv preprint arXiv:2203.06410},
  year   = {2023}
}

备注

This paper was completed in 2020-11.It was first submitted to CVPR 2021 and then ICCV 2021. Finally, it has been accepted by TNNLS in 2022-02 after major revision. Here, I thank Dr.Hou for his important contributions