弱监督文本实例分割
计算机视觉与模式识别
2023-03-24 v2
摘要
文本分割是一项具有许多下游应用的挑战性视觉任务。当前的文本分割方法需要像素级标注,其人力成本高且应用场景受限。本文首次尝试通过桥接文本识别与文本分割来实现弱监督文本实例分割。其思路在于,文本识别方法提供每个文本实例的精确注意力位置,该注意力位置可同时输入至文本自适应细化头(TAR)与文本分割头。具体而言,所提出的 TAR 通过对注意力位置执行两阶段迭代细化操作以拟合对应文本实例的准确边界,从而生成伪标签。同时,文本分割头利用粗略的注意力位置预测分割掩码,并由上述伪标签监督。此外,我们设计了一种掩码增强对比学习,将我们的分割结果视为输入文本图像的增强版本,从而改善视觉表征并进一步提升识别与分割的性能。实验结果表明,所提方法在 ICDAR13-FST(提升 18.95)与 TextSeg(提升 17.80)基准上显著优于弱监督实例分割方法。
引用
@article{arxiv.2303.10848,
title = {Weakly-Supervised Text Instance Segmentation},
author = {Xinyan Zu and Haiyang Yu and Bin Li and Xiangyang Xue},
journal= {arXiv preprint arXiv:2303.10848},
year = {2023}
}