EAFormer:基于边缘感知变换器的场景文本分割
计算机视觉与模式识别
2024-07-25 v1
摘要
场景文本分割旨在从场景图像中裁剪出文本,通常用于辅助生成模型编辑或删除文本。现有的文本分割方法通常会针对更好的性能而涉及各种与文本相关的监督信号,但大多数方法忽略了文本边缘的重要性,而文本边缘对于下游应用至关重要。本文提出了边缘感知变换器,称为EAFormer,用于更准确地分割文本,尤其是在文本边缘处。具体而言,我们首先设计了一个文本边缘提取器,用于检测边缘并过滤除非文本区域的边缘。然后,我们提出了一种边缘引导编码器,使模型更关注文本边缘。最后,采用基于MLP的解码器来预测文本掩码。我们在常用基准数据集上进行了大量实验,以验证EAFormer有效性。实验结果表明,所提出的方法优于以前的方法,尤其在文本边缘的分割方面表现更好。鉴于一些基准数据集(如COCO_TS和MLT_S)的标注不够准确,难以公正地评估我们的方法,我们重新标注了这些数据集。通过实验,我们观察到在使用更准确的标注进行训练时,我们的方法可以获得更高的性能提升。
引用
@article{arxiv.2407.17020,
title = {EAFormer: Scene Text Segmentation with Edge-Aware Transformers},
author = {Haiyang Yu and Teng Fu and Bin Li and Xiangyang Xue},
journal= {arXiv preprint arXiv:2407.17020},
year = {2024}
}
备注
ECCV 2024