用于场景文本识别的关系对比学习与掩码图像建模
计算机视觉与模式识别
2024-11-20 v2
摘要
上下文感知方法通过利用单词的语义先验,在有监督的场景文本识别中取得了显著进展。考虑到 STR 中文本与背景的异质性,我们提出这种上下文先验可以被重新解释为文本元素之间的关系,作为表征学习的有效自监督标签。然而,由于词汇依赖性,文本关系受限于数据集的有限规模,这会导致过拟合问题,从而损害表征质量。为了解决这个问题,我们的工作引入了一个用于 STR 的关系对比学习与掩码图像建模的统一框架(RCMSTR),该框架显式地对丰富的文本关系进行建模。对于关系对比学习分支,我们首先引入关系重排模块以动态地培育新的关系。基于此,我们进一步进行关系对比学习,为帧、子词和词建模层内和层间的层次关系。另一方面,掩码图像建模可以通过掩码自然地增强上下文信息,我们发现块掩码策略对 STR 更有效。为了有效整合关系对比学习和掩码图像建模,我们还引入了一种新颖的解耦设计,旨在减轻掩码图像对对比学习的影响。此外,为了增强掩码图像建模与 CNN 的兼容性,我们提议采用稀疏卷积并在训练中直接与稠密卷积共享权重。所提出的 RCMSTR 在针对不同 STR 相关下游任务的各种评估协议中展示了优越的性能,优于现有的最先进的自监督 STR 技术。消融研究和定性实验结果进一步验证了我们方法的有效性。代码和预训练模型将在 https://github.com/ThunderVVV/RCMSTR 上发布。
引用
@article{arxiv.2411.11219,
title = {Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition},
author = {Tiancheng Lin and Jinglei Zhang and Yi Xu and Kai Chen and Rui Zhang and Chang-Wen Chen},
journal= {arXiv preprint arXiv:2411.11219},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2308.00508