中文

用于场景文本分割中像素级标注生成的弱监督方法

计算机视觉与模式识别 2020-06-30 v1 机器学习 图像与视频处理

摘要

为场景文本分割提供像素级监督 inherently 困难且代价高昂,因此该任务仅有少量小数据集可用。为应对训练数据匮乏,先前基于卷积神经网络(CNN)的方法依赖使用合成数据集进行预训练。然而,合成数据无法复现自然图像的复杂性与多变性。本工作中,我们提出使用弱监督学习方法来减小合成与真实数据间的域偏移。借助 COCO-Text 与 MLT 数据集的边界框监督,我们生成真实图像的弱像素级监督。特别地,我们创建并发布了 COCO-Text-Segmentation(COCO_TS)与 MLT-Segmentation(MLT_S)数据集。这两个数据集用于训练一个专为应对场景文本分割任务某些特性而设计的 CNN——分割多尺度注意力网络(SMANet)。SMANet 在所提数据集上端到端训练,实验表明 COCO_TS 与 MLT_S 是合成图像的有效替代,仅使用少量训练样本即可显著提升性能。

关键词

引用

@article{arxiv.1911.09026,
  title  = {Weak Supervision for Generating Pixel-Level Annotations in Scene Text Segmentation},
  author = {Simone Bonechi and Paolo Andreini and Monica Bianchini and Franco Scarselli},
  journal= {arXiv preprint arXiv:1911.09026},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1904.00818