中文

SimAN:通过相似性感知归一化探索场景文本的自监督表示学习

计算机视觉与模式识别 2022-03-23 v2

摘要

近来自监督表示学习受到场景文本识别领域的相当关注。与以往使用对比学习的研究不同,我们从另一视角切入,即以生成式方式构建表示学习方案。通常,同一文本行中相邻图像块往往具有相似风格,包括笔画、纹理、颜色等。受此常识启发,我们增强一个图像块并以相邻块为引导来自恢复自身。具体地,我们提出相似性感知归一化(SimAN)模块,以识别不同图案并对齐来自引导块的相应风格。如此,网络获得区分复杂图案(如杂乱笔画与混乱背景)的表示能力。实验表明,所提SimAN显著提升表示质量并取得令人满意的性能。此外,我们惊讶地发现,该自监督生成网络在数据合成、文本图像编辑与字体插值方面具有令人印象深刻的潜力,表明所提SimAN具有广泛的实际应用。

关键词

引用

@article{arxiv.2203.10492,
  title  = {SimAN: Exploring Self-Supervised Representation Learning of Scene Text via Similarity-Aware Normalization},
  author = {Canjie Luo and Lianwen Jin and Jingdong Chen},
  journal= {arXiv preprint arXiv:2203.10492},
  year   = {2022}
}

备注

Accepted to appear in CVPR 2022