中文

基于可控图像合成的自监督文本擦除

计算机视觉与模式识别 2022-04-28 v1 人工智能

摘要

近年来场景文本擦除的研究已展现出可喜成果。然而,现有方法需要大量且昂贵的标注数据才能获得鲁棒模型,这限制了其在实际应用中的使用。为此,我们研究了一种无监督场景,提出新颖的自监督文本擦除(Self-Supervised Text Erasing, STE)框架,该框架联合学习合成带有擦除真值的训练图像,并准确擦除真实世界中的文本。我们首先设计了一个风格感知的图像合成函数,基于两种合成机制生成具有多样化风格文本的合成图像。为弥合合成数据与真实数据之间的文本风格差距,构建了一个策略网络,通过两个专门设计的奖励来引导风格参数的选择,从而控制合成机制。随后,带有擦除真值的合成训练图像被用于训练一个由粗到精的擦除网络。为产生更优的擦除输出,设计了一个三元组擦除损失,以强制细化阶段恢复背景纹理。此外,我们提供了一个新数据集(名为PosterErase),包含6万张带有文本的高分辨率海报,对文本擦除任务更具挑战性。所提方法已在PosterErase和广泛使用的SCUT-Enstext数据集上进行了广泛评估。值得注意的是,在PosterErase上,我们的无监督方法在FID指标上达到5.07,相较于现有有监督基线方法,相对性能提升20.9%。

关键词

引用

@article{arxiv.2204.12743,
  title  = {Self-Supervised Text Erasing with Controllable Image Synthesis},
  author = {Gangwei Jiang and Shiyao Wang and Tiezheng Ge and Yuning Jiang and Ying Wei and Defu Lian},
  journal= {arXiv preprint arXiv:2204.12743},
  year   = {2022}
}

备注

10 pages