面向领域自适应场景文本检测的自训练方法
计算机视觉与模式识别
2020-05-26 v1
摘要
尽管基于深度学习的场景文本检测已取得巨大进展,但训练良好的检测器在不同领域下仍会遭受严重的性能下降。通常,在目标领域训练检测器需要海量数据。然而,数据收集和标注既昂贵又耗时。为解决这一问题,我们提出一种自训练框架,能够从未标注的视频或图像中自动挖掘带有伪标签的困难样本。为降低困难样本的噪声,我们基于检测与跟踪结果的融合实现了一个新颖的文本挖掘模块。然后,针对无法获取视频、仅能使用图像的任务,我们设计了一种图像到视频的生成方法。在标准基准数据集(包括 ICDAR2015、MSRA-TD500、ICDAR2017 MLT)上的实验结果证明了我们自训练方法的有效性。经过自训练适配并在真实数据上微调的简单 Mask R-CNN 能够取得与最先进方法相当甚至更优的结果。
引用
@article{arxiv.2005.11487,
title = {Self-Training for Domain Adaptive Scene Text Detection},
author = {Yudi Chen and Wei Wang and Yu Zhou and Fei Yang and Dongbao Yang and Weiping Wang},
journal= {arXiv preprint arXiv:2005.11487},
year = {2020}
}