PageNet:面向端到端弱监督页面级手写中文文本识别
计算机视觉与模式识别
2022-08-01 v1
摘要
手写中文文本识别(HCTR)数十年来一直是活跃的研究课题。然而,以往大多数研究仅关注裁剪文本行图像的识别,忽视了真实应用中文本行检测带来的误差。尽管近年来已提出一些面向页面级文本识别的方法,但它们要么受限于简单版式,要么需要非常详细的标注,包括昂贵的行级甚至字符级边界框。为此,我们提出 PageNet 用于端到端弱监督页面级 HCTR。PageNet 检测并识别字符,并预测它们之间的阅读顺序,在处理包含多方向与弯曲文本行的复杂版式时更加鲁棒和灵活。利用所提出的弱监督学习框架,PageNet 对真实数据仅需标注转录文本;但它仍可在字符和行级别输出检测与识别结果,从而避免标注字符与文本行边界框的人力与成本。在五个数据集上的大量实验证明了 PageNet 优于现有的弱监督与全监督页面级方法。这些实验结果可能激发超越现有基于连接主义时序分类或注意力方法的研究。源代码见 https://github.com/shannanyinxiang/PageNet。
引用
@article{arxiv.2207.14807,
title = {PageNet: Towards End-to-End Weakly Supervised Page-Level Handwritten Chinese Text Recognition},
author = {Dezhi Peng and Lianwen Jin and Yuliang Liu and Canjie Luo and Songxuan Lai},
journal= {arXiv preprint arXiv:2207.14807},
year = {2022}
}
备注
Accepted to appear in International Journal of Computer Vision (IJCV)