中文

LRANet:基于低秩近似网络实现准确高效场景文本检测

计算机视觉与模式识别 2024-01-25 v5

摘要

近年来,通过预测参数化文本形状进行文本定位的基于回归的方法在场景文本检测中日益流行。然而,现有参数化文本形状方法因忽视文本特有形状信息的利用,在建模任意形状文本方面仍存在局限。此外,整个流程的时间消耗被严重忽视,导致整体推理速度欠佳。针对这些问题,我们首先提出一种基于低秩近似的新型参数化文本形状方法。与其他采用与数据无关的参数化形状表示法不同,我们的方法利用奇异值分解,并使用从标注文本轮廓中学习到的少量特征向量重建文本形状。通过挖掘不同文本轮廓间的形状关联,该方法在形状表示上实现了一致性、紧凑性、简洁性与鲁棒性。接下来,我们提出一种用于加速的双重分配方案。其采用稀疏分配分支加速推理速度,同时通过稠密分配分支为训练提供充足的监督信号。基于这些设计,我们实现了名为LRANet的准确高效任意形状文本检测器。在多个具挑战性的基准上进行了大量实验,表明LRANet相较于SOTA方法具有更优的精度与效率。代码见:\url{https://github.com/ychensu/LRANet.git}

关键词

引用

@article{arxiv.2306.15142,
  title  = {LRANet: Towards Accurate and Efficient Scene Text Detection with Low-Rank Approximation Network},
  author = {Yuchen Su and Zhineng Chen and Zhiwen Shao and Yuning Du and Zhilong Ji and Jinfeng Bai and Yong Zhou and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2306.15142},
  year   = {2024}
}

备注

Accepted to AAAI 2024