中文

仅基于文本的解码器预训练用于场景文本识别

计算机视觉与模式识别 2024-08-13 v1

摘要

场景文本识别(STR)的预训练方法已取得显著进展,主要依赖于合成数据集。然而,合成图像与真实图像之间的领域差距使得获取与真实场景图像对齐良好的特征表示面临挑战,从而限制了这些方法的性能。我们注意到,像 CLIP 这样在大规模真实图像-文本对上预训练的视觉-语言模型,能够在统一的嵌入空间中有效对齐图像和文本,这表明有可能仅从文本中推导出真实图像的特征表示。基于这一前提,我们提出了一种名为 DPTR(Decoder Pre-training with only Text for STR)的新方法。DPTR 将 CLIP 文本编码器产生的文本嵌入视为伪视觉嵌入,并利用它们来预训练解码器。我们引入了一种离线随机扰动(ORP)策略,通过融入从 CLIP 图像编码器提取的自然图像嵌入来丰富文本嵌入的多样性,有效引导解码器获取真实图像的潜在表示。此外,我们引入了一个特征合并单元(FMU),引导提取的视觉嵌入聚焦于文本图像中的字符前景,从而使预训练的解码器能够更高效、更准确地工作。在各种 STR 解码器和语言识别任务上的广泛实验证实了 DPTR 的广泛适用性和显著性能,为 STR 预训练提供了新的思路。代码可在 https://github.com/Topdu/OpenOCR 获取。

关键词

引用

@article{arxiv.2408.05706,
  title  = {Decoder Pre-Training with only Text for Scene Text Recognition},
  author = {Shuai Zhao and Yongkun Du and Zhineng Chen and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2408.05706},
  year   = {2024}
}

备注

Accepted by ACM MM 2024