中文

文本识别的自监督学习:批判性综述

计算机视觉与模式识别 2025-06-06 v2

摘要

文本识别(TR)指关注从图像中检索文本信息的研究领域,近十年来由于深度神经网络(DNN)的应用而取得了显著进展。然而,这些解决方案通常需要大量的人工标注或合成数据。为此,自监督学习(SSL)因利用大量无标签数据训练DNN以生成有意义且稳健的表示而受到关注。尽管SSL起初因TR的独特特征被忽视,但近年来出现了大量专为该领域开发的SSL方法。这种快速发展导致许多方法独立探索,未考虑之前的方法或进行比较,从而阻碍了该领域的进展。因此,本文旨在整合TR中SSL的应用,提供当前最先进技术的批判性和全面概述。我们将审阅和分析现有方法,比较其结果,突出当前文献中的不一致之处。这种彻底的分析旨在为该领域提供一般性见解,提出标准化建议,识别新的研究方向,并促进其proper开发。

关键词

引用

@article{arxiv.2407.19889,
  title  = {Self-Supervised Learning for Text Recognition: A Critical Survey},
  author = {Carlos Penarrubia and Jose J. Valero-Mas and Jorge Calvo-Zaragoza},
  journal= {arXiv preprint arXiv:2407.19889},
  year   = {2025}
}

备注

Published at International Journal of Computer Vision (IJCV)