中文

用于文本识别的序列到序列对比学习

计算机视觉与模式识别 2020-12-22 v1

摘要

我们提出一种用于视觉表示的序列到序列对比学习(SeqCLR)框架,并将其应用于文本识别。为适配序列到序列结构,将每个特征图划分为不同实例,并在其上计算对比损失。该操作使我们能够在子词级别进行对比,从每张图像中提取若干正样本对与多个负样本。为获得有效的文本识别视觉表示,我们进一步提出新颖的增广启发式方法、不同的编码器架构与定制的投影头。在手写文本与场景文本上的实验表明,当文本解码器在所学表示上训练时,我们的方法优于非序列对比方法。此外,当监督量减少时,SeqCLR 相比有监督训练显著提升性能;当使用 100% 标签微调时,我们的方法在标准手写文本识别基准上取得当前最优结果。

关键词

引用

@article{arxiv.2012.10873,
  title  = {Sequence-to-Sequence Contrastive Learning for Text Recognition},
  author = {Aviad Aberdam and Ron Litman and Shahar Tsiper and Oron Anschel and Ron Slossberg and Shai Mazor and R. Manmatha and Pietro Perona},
  journal= {arXiv preprint arXiv:2012.10873},
  year   = {2020}
}