面向自监督场景文本识别的语言学感知掩码图像建模
计算机视觉与模式识别
2025-03-25 v1
摘要
文本图像具有独特的双重特性,同时包含视觉和语言信息。视觉部分涵盖结构与外观特征,而语言维度则包含上下文与语义元素。在视觉质量退化的情况下,语言模式成为理解的重要补充,这凸显了将两方面结合以实现鲁棒场景文本识别 (STR) 的必要性。当代 STR 方法通常使用语言模型或语义推理模块来捕捉语言特征,这往往需要大规模标注数据集。自监督学习由于缺乏标注,在解耦与全局上下文相关的语言特征方面面临挑战。通常,序列对比学习强调局部特征的对齐,而掩码图像建模 (MIM) 倾向于利用局部结构来重建视觉模式,导致语言知识有限。本文提出一种语言学感知掩码图像建模 (LMIM) 方法,通过一个独立的分支将语言信息注入 MIM 的解码过程。具体而言,我们设计了一个语言学对齐模块,利用具有不同视觉外观的输入提取与视觉无关的特征作为语言学指导。由于特征超越了单纯的视觉结构,LMIM 必须考虑全局上下文才能实现重建。在多个基准上的大量实验定量地证明了我们方法的 SOTA 性能,而注意力可视化则定性地展示了视觉与语言信息的同步捕获。
引用
@article{arxiv.2503.18746,
title = {Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition},
author = {Yifei Zhang and Chang Liu and Jin Wei and Xiaomeng Yang and Yu Zhou and Can Ma and Xiangyang Ji},
journal= {arXiv preprint arXiv:2503.18746},
year = {2025}
}
备注
CVPR 2025