面向场景文本识别的关系对比学习
计算机视觉与模式识别
2023-08-02 v1
摘要
上下文感知方法通过引入来自词语的语义先验,在监督式场景文本识别中取得了巨大成功。我们认为,由于文本与背景的异质性,此类先验上下文信息可解释为文本基元之间的关系,其能为表示学习提供有效的自监督标签。然而,由于词汇依赖,文本关系受限于数据集的有限规模,这导致了过拟合问题并损害了表示的鲁棒性。为此,我们提出通过重排、层次化与交互来丰富文本关系,并设计了一个称为RCLSTR的统一框架:面向场景文本识别的关系对比学习(Relational Contrastive Learning for Scene Text Recognition)。基于因果性,我们从理论上解释了三个模块抑制了由上下文先验引起的偏差,从而保证了表示的鲁棒性。在表示质量上的实验表明,我们的方法优于最先进的自监督STR方法。代码见 https://github.com/ThunderVVV/RCLSTR。
引用
@article{arxiv.2308.00508,
title = {Relational Contrastive Learning for Scene Text Recognition},
author = {Jinglei Zhang and Tiancheng Lin and Yi Xu and Kai Chen and Rui Zhang},
journal= {arXiv preprint arXiv:2308.00508},
year = {2023}
}
备注
Accepted by ACMMM 2023