中文

从二到一:一种具有视觉语言建模网络的场景文本识别器

计算机视觉与模式识别 2021-08-24 v1

摘要

本文中,我们摒弃主流的复杂语言模型,并重新思考场景文本识别中的语言学习过程。与以往将视觉与语言信息置于两个独立结构中的方法不同,我们提出视觉语言建模网络(VisionLAN),其通过将语言能力直接赋予视觉模型,将视觉与语言信息视为一体。具体而言,我们在训练阶段引入对字符级遮挡特征图的文本识别。该操作引导视觉模型在视觉线索混淆(如遮挡、噪声等)时,不仅利用字符的视觉纹理,还利用视觉上下文中的语言信息进行识别。由于语言信息随视觉特征一同获取而无需额外语言模型,VisionLAN 将速度显著提升 39%,并自适应地考虑语言信息以增强视觉特征从而实现准确识别。此外,我们提出遮挡场景文本(OST)数据集,以评估在字符级视觉线索缺失情形下的性能。在多个基准上的最先进结果证明了我们的有效性。代码与数据集可在 https://github.com/wangyuxin87/VisionLAN 获取。

关键词

引用

@article{arxiv.2108.09661,
  title  = {From Two to One: A New Scene Text Recognizer with Visual Language Modeling Network},
  author = {Yuxin Wang and Hongtao Xie and Shancheng Fang and Jing Wang and Shenggao Zhu and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2108.09661},
  year   = {2021}
}

备注

Accept by ICCV2021