中文

WeText: 弱监督场景文本检测

计算机视觉与模式识别 2017-10-16 v1

摘要

对大量标注训练数据的需求已成为各种深度学习系统的普遍限制。本文提出一种弱监督场景文本检测方法(WeText),通过从未标注或弱标注数据中学习,训练鲁棒且准确的场景文本检测模型。利用在一个小型全标注数据集上训练的“轻量”监督模型,我们分别在一个大型未标注数据集和一个大型弱标注数据集上探索半监督和弱监督学习。对于无监督学习,将轻量监督模型应用于未标注数据集以搜索更多字符训练样本,这些样本进一步与小型标注数据集结合以重新训练一个更优的字符检测模型。对于弱监督学习,字符搜索由广泛可用且更易准备的词/文本行高层标注引导。此外,我们通过改编基于回归的深度网络设计了一个统一的场景字符检测器,极大缓解了大多数传统方法中普遍存在的误差累积问题。在不同未标注和弱标注数据集上的大量实验表明,在这两种场景下场景文本检测性能均能显著提升,其中弱监督学习仅使用229张全标注场景文本图像即可达到最先进(state-of-the-art)性能。

关键词

引用

@article{arxiv.1710.04826,
  title  = {WeText: Scene Text Detection under Weak Supervision},
  author = {Shangxuan Tian and Shijian Lu and Chongshou Li},
  journal= {arXiv preprint arXiv:1710.04826},
  year   = {2017}
}

备注

accepted by ICCV2017