中文

用于提升场景文本检测器的视觉-语言预训练

计算机视觉与模式识别 2022-05-02 v1 人工智能 计算与语言

摘要

近来,视觉-语言联合表示学习已被证明在多种场景下高度有效。在本文中,我们专门将视觉-语言联合学习适配于场景文本检测这一任务,该任务本质上涉及视觉与语言两种模态之间的跨模态交互,因为文本是语言的书写形式。具体而言,我们提出通过视觉-语言预训练来学习上下文化联合表示,以增强场景文本检测器的性能。为此,我们设计了一个带有图像编码器、文本编码器和跨模态编码器的预训练架构,以及三个预训练任务:图像-文本对比学习(ITC)、掩码语言建模(MLM)和图像中词预测(WIP)。该预训练模型能够生成具有更丰富语义的更具信息性的表示,可轻易惠及下游文本检测任务中的现有场景文本检测器(如EAST和PSENet)。在标准基准上的大量实验表明,所提范式能显著提升各类代表性文本检测器的性能,优于以往的预训练方法。代码与预训练模型将公开发布。

关键词

引用

@article{arxiv.2204.13867,
  title  = {Vision-Language Pre-Training for Boosting Scene Text Detectors},
  author = {Sibo Song and Jianqiang Wan and Zhibo Yang and Jun Tang and Wenqing Cheng and Xiang Bai and Cong Yao},
  journal= {arXiv preprint arXiv:2204.13867},
  year   = {2022}
}

备注

Accepted by CVPR 2022