面向文本识别的自监督字符到字符蒸馏方法
计算机视觉与模式识别
2023-08-21 v4
摘要
在处理复杂文本图像(如不规则结构、低分辨率、严重遮挡和光照不均)时,现有的有监督文本识别方法十分依赖数据。尽管这些方法采用大规模合成文本图像以减少对标注真实图像的依赖,领域鸿沟仍限制了识别性能。因此,通过自监督学习在未标注真实图像上探索鲁棒的文本特征表示是一个良好的解决方案。然而,现有的自监督文本识别方法沿水平轴粗略分割视觉特征来进行序列到序列的表示学习,这限制了增强的灵活性,因为基于大几何的增强可能导致序列到序列特征不一致。受此启发,我们提出了一种新颖的自监督字符到字符蒸馏方法 CCD,其支持多样化增强以促进通用文本表示学习。具体而言,我们通过设计自监督字符分割模块来描绘未标注真实图像的字符结构。随后,CCD 利用图像两个增强视图之间的变换矩阵,在灵活增强下轻松丰富局部字符的多样性并保持其成对对齐。实验表明,CCD 取得了最先进(SOTA)的结果,在文本识别上平均性能提升 1.38%,在文本分割上提升 1.7%,在文本超分辨率上 PSNR 提升 0.24 dB、SSIM 提升 0.0321。代码见 https://github.com/TongkunGuan/CCD。
引用
@article{arxiv.2211.00288,
title = {Self-supervised Character-to-Character Distillation for Text Recognition},
author = {Tongkun Guan and Wei Shen and Xue Yang and Qi Feng and Zekun Jiang and Xiaokang Yang},
journal= {arXiv preprint arXiv:2211.00288},
year = {2023}
}
备注
Accepted by ICCV2023