Text-DIAE:一种用于文本识别与文档增强的自监督退化不变自编码器
计算机视觉与模式识别
2022-08-19 v4
摘要
在本文中,我们提出一种文本退化不变自编码器(Text-DIAE),这是一种自监督模型,旨在处理两项任务:文本识别(手写或场景文本)与文档图像增强。我们首先采用基于 transformer 的架构,该架构包含三个作为学习目标的预训练任务,可在不使用标注数据的情况下进行优化。每个预训练目标都专门针对最终的下游任务而设计。我们进行了若干消融实验,证实了所选预训练任务的设计选择。重要的是,所提出的模型不存在先前基于对比损失的最先进方法的局限性,同时所需收敛的数据样本显著更少。最后,我们证明我们的方法在手写与场景文本识别以及文档图像增强的现有监督与自监督设定中均超越了最先进水平。我们的代码与训练好的模型将在~\url{http://Upon_Acceptance} 公开提供。
引用
@article{arxiv.2203.04814,
title = {Text-DIAE: A Self-Supervised Degradation Invariant Autoencoders for Text Recognition and Document Enhancement},
author = {Mohamed Ali Souibgui and Sanket Biswas and Andres Mafla and Ali Furkan Biten and Alicia Fornés and Yousri Kessentini and Josep Lladós and Lluis Gomez and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2203.04814},
year = {2022}
}
备注
Preprint