用于高效任意形状场景文本检测的可变形核扩展模型
计算机视觉与模式识别
2023-03-29 v1
摘要
由于文本形状和长宽比的高度变化,场景文本检测是一项具有挑战性的计算机视觉任务。在本工作中,我们提出了一种名为可变形核扩展(Deformable Kernel Expansion, DKE)的场景文本检测器,它结合了分割式和基于轮廓的检测器的优点。DKE 采用分割模块将收缩的文本区域分割为文本核,然后通过回归逐顶点偏移将文本核轮廓扩展以获得文本边界。通过分割生成文本核使 DKE 能够继承基于分割的检测器对任意形状文本区域建模的能力。利用一些采样顶点回归核轮廓使 DKE 能够避免复杂的像素级后处理,并像基于轮廓的检测器一样更好地学习轮廓形变。此外,我们提出了最优二部图匹配损失(Optimal Bipartite Graph Matching Loss, OBGML),用于度量预测轮廓与真值之间的匹配误差,从而高效最小化全局轮廓匹配距离。在 CTW1500、Total-Text、MSRA-TD500 和 ICDAR2015 上的大量实验表明,DKE 在场景文本检测的精度与效率之间取得了良好权衡。
引用
@article{arxiv.2303.15737,
title = {Deformable Kernel Expansion Model for Efficient Arbitrary-shaped Scene Text Detection},
author = {Tao He and Sheng Huang and Wenhao Tang and Bo Liu},
journal= {arXiv preprint arXiv:2303.15737},
year = {2023}
}