OrigamiNet:通过学习展开实现弱监督、免分割、一步式全页文本识别
计算机视觉与模式识别
2020-06-16 v1 机器学习
摘要
文本识别是一项主要的计算机视觉任务,伴随一系列挑战。其中一个传统挑战是文本识别与分割的耦合特性。这个问题在过去几十年中已逐步得到解决,从基于分割的识别发展到免分割方法,后者被证明更准确,且数据标注成本更低。我们从免分割的单行识别迈向免分割的多行/全页识别。我们提出了一种新颖且简单的神经网络模块,称为OrigamiNet,它可以增强任何经过CTC训练的全卷积单行文本识别器,通过为模型提供足够的空间容量,使其能够将二维输入信号正确折叠为一维而不丢失信息,从而将其转换为多行版本。这种修改后的网络可以使用完全相同的简单原始流程进行训练,并且仅使用**未分割**的图像和文本对。我们进行了一系列可解释性实验,表明我们训练出的模型学习到了准确的隐式行分割。我们在IAM和ICDAR 2017 HTR手写识别基准测试上取得了最先进的字符错误率,超越了文献中所有其他方法。在IAM上,我们甚至超越了在训练期间使用精确定位信息的单行方法。我们的代码可在\url{https://github.com/IntuitionMachines/OrigamiNet}在线获取。
引用
@article{arxiv.2006.07491,
title = {OrigamiNet: Weakly-Supervised, Segmentation-Free, One-Step, Full Page Text Recognition by learning to unfold},
author = {Mohamed Yousef and Tom E. Bishop},
journal= {arXiv preprint arXiv:2006.07491},
year = {2020}
}
备注
Accepted to CVPR 2020