中文

面向领域自适应场景文本检测的自训练方法

计算机视觉与模式识别 2020-05-26 v1

摘要

尽管基于深度学习的场景文本检测已取得巨大进展,但训练良好的检测器在不同领域下仍会遭受严重的性能下降。通常,在目标领域训练检测器需要海量数据。然而,数据收集和标注既昂贵又耗时。为解决这一问题,我们提出一种自训练框架,能够从未标注的视频或图像中自动挖掘带有伪标签的困难样本。为降低困难样本的噪声,我们基于检测与跟踪结果的融合实现了一个新颖的文本挖掘模块。然后,针对无法获取视频、仅能使用图像的任务,我们设计了一种图像到视频的生成方法。在标准基准数据集(包括 ICDAR2015、MSRA-TD500、ICDAR2017 MLT)上的实验结果证明了我们自训练方法的有效性。经过自训练适配并在真实数据上微调的简单 Mask R-CNN 能够取得与最先进方法相当甚至更优的结果。

关键词

引用

@article{arxiv.2005.11487,
  title  = {Self-Training for Domain Adaptive Scene Text Detection},
  author = {Yudi Chen and Wei Wang and Yu Zhou and Fei Yang and Dongbao Yang and Weiping Wang},
  journal= {arXiv preprint arXiv:2005.11487},
  year   = {2020}
}