面向自然场景文本检测的合成到真实无监督域自适应
计算机视觉与模式识别
2020-09-04 v1 人工智能
摘要
基于深度学习的场景文本检测在充足标注训练数据支撑下可取得较优性能。然而,人工标注耗时费力。在极端情况下,相应的标注数据并不可用。利用合成数据是一种极具前景的解决方案,但合成数据集与真实数据集之间存在域分布失配。为应对严重的域分布失配,我们提出一种面向场景文本检测的合成到真实域自适应方法,将知识从合成数据(源域)迁移至真实数据(目标域)。本文引入文本自训练(TST)方法与对抗式文本实例对齐(ATA)用于域自适应场景文本检测。ATA 通过以对抗方式训练域分类器,帮助网络学习域不变特征。TST 减轻了由不精确伪标签带来的假阳性(FPs)与假阴性(FNs)的不利影响。这两个组件在从合成场景到真实场景的自适应过程中对提升场景文本检测器性能具有积极作用。我们通过从 SynthText、VISD 迁移至 ICDAR2015、ICDAR2013 来评估所提方法。结果表明该方法有效,提升幅度达 10%,对域自适应场景文本检测具有重要探索意义。代码见 https://github.com/weijiawu/SyntoReal_STD
引用
@article{arxiv.2009.01766,
title = {Synthetic-to-Real Unsupervised Domain Adaptation for Scene Text Detection in the Wild},
author = {Weijia Wu and Ning Lu and Enze Xie},
journal= {arXiv preprint arXiv:2009.01766},
year = {2020}
}