CLIP4STR:基于预训练视觉-语言模型的场景文本识别简单基线
计算机视觉与模式识别
2024-12-25 v4
摘要
预训练的视觉-语言模型(VLMs)是各类下游任务事实上的基础模型。然而,场景文本识别方法仍偏好在单一模态(即视觉模态)上预训练的骨干网络,尽管 VLMs 有潜力作为强大的场景文本读取器。例如,CLIP 能鲁棒地识别图像中的规则(水平)与不规则(旋转、弯曲、模糊或被遮挡)文本。凭借此类优点,我们将 CLIP 转化为场景文本读取器,并引入 CLIP4STR,一种构建于 CLIP 图像与文本编码器之上的简单而有效的 STR 方法。它有两个编码器-解码器分支:视觉分支与跨模态分支。视觉分支基于视觉特征提供初始预测,跨模态分支通过处理视觉特征与文本语义之间的差异来精炼该预测。为充分利用两分支的能力,我们设计了一种双预测与精炼解码方案用于推理。我们在模型规模、预训练数据与训练数据方面对 CLIP4STR 进行扩展,在 13 个 STR 基准上取得了最优性能。此外,提供了全面的实证研究以增强对 CLIP 适配于 STR 的理解。我们的方法为未来基于 VLMs 的 STR 研究建立了简单而强大的基线。
引用
@article{arxiv.2305.14014,
title = {CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model},
author = {Shuai Zhao and Ruijie Quan and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2305.14014},
year = {2024}
}
备注
Accepted by T-IP. A PyTorch re-implementation is at https://github.com/VamosC/CLIP4STR (Credit on GitHub@VamosC)