中文

Char-SAM:利用字符级视觉提示将Segment Anything Model转变为场景文本分割标注器

计算机视觉与模式识别 2024-12-31 v1

摘要

最近出现的Segment Anything Model(SAM)使得通过使用边界框作为提示,可以经济高效地处理各种特定领域的分割任务。然而,在场景文本分割中,SAM无法达到理想的性能。词级边界框作为提示对于字符来说过于粗糙,而字符级边界框作为提示则存在过分割和欠分割问题。在本文中,我们提出了一种名为Char-SAM的自动标注流程,它将SAM转变为一种低成本的、带有字符级视觉提示的分割标注器。具体来说,利用一些现有的带有词级边界框标注的文本检测数据集,我们首先使用字符边界框细化(CBR)模块生成更细粒度的字符级边界框提示。接下来,我们在字符字形细化(CGR)模块中使用与文本字符类别对应的字形信息作为新的提示,以指导SAM生成更准确的分割掩码,解决过分割和欠分割问题。这些模块充分利用SAM的边界框到掩码能力,自动生成高质量的文本分割标注。在TextSeg上的大量实验验证了Char-SAM的有效性。其无需训练的特性还使得能够从真实世界数据集(如COCO-Text和MLT17)生成高质量的场景文本分割数据集。

关键词

引用

@article{arxiv.2412.19917,
  title  = {Char-SAM: Turning Segment Anything Model into Scene Text Segmentation Annotator with Character-level Visual Prompts},
  author = {Enze Xie and Jiaho Lyu and Daiqing Wu and Huawen Shen and Yu Zhou},
  journal= {arXiv preprint arXiv:2412.19917},
  year   = {2024}
}