中文

利用对抗学习分离内容与风格以识别自然场景文本

计算机视觉与模式识别 2020-12-15 v3

摘要

我们提出从新视角通过分离文本内容与复杂背景来改进文本识别。由于原始GAN不足以稳健地生成自然图像中的序列状字符,我们提出了一种用于图像中多字符生成与识别的对抗学习框架。该框架由基于注意力的识别器与生成对抗架构组成。此外,为解决缺乏配对训练样本的问题,我们设计了一种交互式联合训练方案,将识别器的注意力掩码共享给判别器,使判别器能够提取每个字符的特征以进行进一步的对抗训练。得益于字符级对抗训练,我们的框架仅需非配对的简单数据作为风格监督。每个仅含一个随机选取字符的目标风格样本可在训练过程中简单地在线合成。这一点意义重大,因为训练不需要昂贵的配对样本或字符级标注。因此,仅需输入图像及相应文本标签。除背景的风格归一化外,我们精炼字符图案以降低识别难度。提出一种反馈机制以弥合判别器与识别器之间的差距。因此,判别器可根据识别器的混淆情况引导生成器,使生成的图案更清晰易识别。在包括规则与不规则文本在内的多个基准上的实验表明,我们的方法显著降低了识别难度。我们的框架可集成到近期识别方法中,以实现新的state-of-the-art识别精度。

关键词

引用

@article{arxiv.2001.04189,
  title  = {Separating Content from Style Using Adversarial Learning for Recognizing Text in the Wild},
  author = {Canjie Luo and Qingxiang Lin and Yuliang Liu and Lianwen Jin and Chunhua Shen},
  journal= {arXiv preprint arXiv:2001.04189},
  year   = {2020}
}

备注

Accepted to appear in International Journal of Computer Vision (IJCV)