SimAN:通过相似性感知归一化探索场景文本的自监督表示学习
计算机视觉与模式识别
2022-03-23 v2
摘要
近来自监督表示学习受到场景文本识别领域的相当关注。与以往使用对比学习的研究不同,我们从另一视角切入,即以生成式方式构建表示学习方案。通常,同一文本行中相邻图像块往往具有相似风格,包括笔画、纹理、颜色等。受此常识启发,我们增强一个图像块并以相邻块为引导来自恢复自身。具体地,我们提出相似性感知归一化(SimAN)模块,以识别不同图案并对齐来自引导块的相应风格。如此,网络获得区分复杂图案(如杂乱笔画与混乱背景)的表示能力。实验表明,所提SimAN显著提升表示质量并取得令人满意的性能。此外,我们惊讶地发现,该自监督生成网络在数据合成、文本图像编辑与字体插值方面具有令人印象深刻的潜力,表明所提SimAN具有广泛的实际应用。
引用
@article{arxiv.2203.10492,
title = {SimAN: Exploring Self-Supervised Representation Learning of Scene Text via Similarity-Aware Normalization},
author = {Canjie Luo and Lianwen Jin and Jingdong Chen},
journal= {arXiv preprint arXiv:2203.10492},
year = {2022}
}
备注
Accepted to appear in CVPR 2022