中文

基于 CLIP 的对称语言特征蒸馏用于场景文本识别

计算机视觉与模式识别 2023-10-11 v2

摘要

本文探索了对比语言-图像预训练(CLIP)模型在场景文本识别(STR)中的潜力,并建立了一种新颖的对称语言特征蒸馏框架(称为 CLIP-OCR),以利用 CLIP 中的视觉与语言知识。不同于以往基于 CLIP 的方法主要关注视觉编码上的特征泛化,我们提出了一种对称蒸馏策略(SDS),进一步捕获 CLIP 文本编码器中的语言知识。通过将 CLIP 图像编码器与反向的 CLIP 文本编码器级联,构建了一个对称结构,形成从图像到文本的特征流,覆盖用于蒸馏的视觉与语言信息。得益于 CLIP 中的自然对齐,该引导流提供了从视觉到语言的渐进式优化目标,可逐层监督 STR 特征前向过程。此外,提出了一种新的语言一致性损失(LCL),通过在优化过程中考虑二阶统计量来增强语言能力。总体而言,CLIP-OCR 首次为 STR 任务设计了图像与文本之间的平滑过渡。大量实验证明了 CLIP-OCR 的有效性,在六个流行的 STR 基准上取得了 93.8% 的平均准确率。代码将发布于 https://github.com/wzx99/CLIPOCR。

关键词

引用

@article{arxiv.2310.04999,
  title  = {Symmetrical Linguistic Feature Distillation with CLIP for Scene Text Recognition},
  author = {Zixiao Wang and Hongtao Xie and Yuxin Wang and Jianjun Xu and Boqiang Zhang and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2310.04999},
  year   = {2023}
}

备注

Accepted by ACM MM 2023