COCO_TS 数据集:基于弱监督的像素级标注用于场景文本分割
计算机视觉与模式识别
2019-09-25 v6
摘要
缺乏具有像素级监督的大规模数据集是训练深度卷积网络进行场景文本分割的一大障碍。为此,通常采用合成数据生成来扩充训练集。然而,合成数据无法复现自然图像的复杂性与多变性。本文使用弱监督学习方法以减少在真实与合成数据上训练的分布偏移。我们为文本检测数据集(即仅提供边界框标注的数据集)生成像素级监督。具体而言,创建并发布了 COCO-Text-Segmentation(COCO_TS)数据集,其为 COCO-Text 数据集提供像素级监督。所生成的标注用于训练深度卷积神经网络进行语义分割。实验表明,所提数据集可替代合成数据,仅使用少量训练样本即可显著提升性能。
引用
@article{arxiv.1904.00818,
title = {COCO_TS Dataset: Pixel-level Annotations Based on Weak Supervision for Scene Text Segmentation},
author = {Simone Bonechi and Paolo Andreini and Monica Bianchini and Franco Scarselli},
journal= {arXiv preprint arXiv:1904.00818},
year = {2019}
}