中文

基于属性学习的少样本文本分割 TSAL

计算机视觉与模式识别 2025-04-16 v1

摘要

近年来,监督式学习在场景文本分割方面取得了快速发展。然而,缺乏高质量数据集以及像素标注的高成本严重限制了其发展。鉴于在下游任务中少样本学习方法表现良好,我们探索将少样本学习方法应用于场景文本分割。我们提出TSAL方法,利用CLIP的先验知识学习文本属性以实现分割。为充分利用图像中的语义和纹理信息,提出视觉引导分支分别提取文本和背景特征。为减少数据依赖并提高文本检测准确度,采用自适应提示引导分支,通过有效的自适应提示模板捕获各种文本属性。为实现自适应提示捕获 distinctive 文本特征和复杂背景分布,我们提出自适应特征对齐模块(AFA)。通过对齐不同属性的可学习标记与视觉特征和提示原型,AFA使自适应提示能够捕获通用和 distinctive 属性信息。TSAL能够捕获文本的独特属性,并仅通过少量图像即可实现精确分割。实验表明,在少样本设置下,我们的方法在多个文本分割数据集上实现了最先进的性能,并在文本相关领域展现出巨大的潜力。

关键词

引用

@article{arxiv.2504.11164,
  title  = {TSAL: Few-shot Text Segmentation Based on Attribute Learning},
  author = {Chenming Li and Chengxu Liu and Yuanting Fan and Xiao Jin and Xingsong Hou and Xueming Qian},
  journal= {arXiv preprint arXiv:2504.11164},
  year   = {2025}
}