中文

面向场景文本识别的关系对比学习

计算机视觉与模式识别 2023-08-02 v1

摘要

上下文感知方法通过引入来自词语的语义先验,在监督式场景文本识别中取得了巨大成功。我们认为,由于文本与背景的异质性,此类先验上下文信息可解释为文本基元之间的关系,其能为表示学习提供有效的自监督标签。然而,由于词汇依赖,文本关系受限于数据集的有限规模,这导致了过拟合问题并损害了表示的鲁棒性。为此,我们提出通过重排、层次化与交互来丰富文本关系,并设计了一个称为RCLSTR的统一框架:面向场景文本识别的关系对比学习(Relational Contrastive Learning for Scene Text Recognition)。基于因果性,我们从理论上解释了三个模块抑制了由上下文先验引起的偏差,从而保证了表示的鲁棒性。在表示质量上的实验表明,我们的方法优于最先进的自监督STR方法。代码见 https://github.com/ThunderVVV/RCLSTR。

关键词

引用

@article{arxiv.2308.00508,
  title  = {Relational Contrastive Learning for Scene Text Recognition},
  author = {Jinglei Zhang and Tiancheng Lin and Yi Xu and Kai Chen and Rui Zhang},
  journal= {arXiv preprint arXiv:2308.00508},
  year   = {2023}
}

备注

Accepted by ACMMM 2023