中文

语言至关重要:一种用于场景文本检测与识别的弱监督视觉-语言预训练方法

计算机视觉与模式识别 2022-11-15 v3

摘要

近年来,视觉-语言预训练(VLP)技术通过联合学习视觉与文本表征,极大地惠及了各类视觉-语言任务,由于场景文本图像中富含视觉与文本信息,其直观上有助于光学字符识别(OCR)任务。然而,这些方法难以很好地应对OCR任务,原因在于实例级文本编码与图像-文本对获取(即图像及其中的捕获文本)均存在困难。本文提出一种弱监督预训练方法oCLIP,其可通过联合学习与对齐视觉和文本信息来获取有效的场景文本表征。我们的网络由分别提取视觉与文本特征的图像编码器和字符感知文本编码器,以及建模文本与视觉特征间交互以学习有效场景文本表征的视觉-文本解码器组成。借助文本特征的学习,预训练模型能够以字符感知能力很好地关注图像中的文本。此外,这些设计使得从弱标注文本(即图像中无文本边界框的局部文本)中学习成为可能,极大缓解了数据标注限制。在ICDAR2019-LSVT弱标注图像上的实验表明,将我们的预训练模型权重迁移至其他文本检测与识别网络时,F值分别提升+2.5%和+4.8%。此外,所提方法在多个公开数据集(如Total-Text和CTW1500上分别+3.2%和+1.3%)上一致优于现有预训练技术。

关键词

引用

@article{arxiv.2203.03911,
  title  = {Language Matters: A Weakly Supervised Vision-Language Pre-training Approach for Scene Text Detection and Spotting},
  author = {Chuhui Xue and Wenqing Zhang and Yu Hao and Shijian Lu and Philip Torr and Song Bai},
  journal= {arXiv preprint arXiv:2203.03911},
  year   = {2022}
}

备注

Accepted by ECCV2022 for oral presentation