用于文本识别的序列到序列对比学习
计算机视觉与模式识别
2020-12-22 v1
摘要
我们提出一种用于视觉表示的序列到序列对比学习(SeqCLR)框架,并将其应用于文本识别。为适配序列到序列结构,将每个特征图划分为不同实例,并在其上计算对比损失。该操作使我们能够在子词级别进行对比,从每张图像中提取若干正样本对与多个负样本。为获得有效的文本识别视觉表示,我们进一步提出新颖的增广启发式方法、不同的编码器架构与定制的投影头。在手写文本与场景文本上的实验表明,当文本解码器在所学表示上训练时,我们的方法优于非序列对比方法。此外,当监督量减少时,SeqCLR 相比有监督训练显著提升性能;当使用 100% 标签微调时,我们的方法在标准手写文本识别基准上取得当前最优结果。
引用
@article{arxiv.2012.10873,
title = {Sequence-to-Sequence Contrastive Learning for Text Recognition},
author = {Aviad Aberdam and Ron Litman and Shahar Tsiper and Oron Anschel and Ron Slossberg and Shai Mazor and R. Manmatha and Pietro Perona},
journal= {arXiv preprint arXiv:2012.10873},
year = {2020}
}