通过图像到序列提取的全页手写识别
计算机视觉与模式识别
2022-06-28 v3 人工智能
计算与语言
机器学习
摘要
我们提出一种基于神经网络的手写文本识别(HTR)模型架构,可经训练识别整页手写或印刷文本而无需图像分割。该架构基于图像到序列(Image to Sequence)结构,能够提取图像中存在的文本并正确排序,且不对文本与非文本的方向、版式和大小施加任何约束。此外,它也可被训练生成与格式、版式和内容相关的辅助标记。我们使用字符级词表,从而支持任意学科的语言与术语。该模型在IAM数据集上取得了段落级识别的新SOTA。当在真实世界手写自由形式测试答案的扫描件上评估时——这些扫描件带有弯曲和倾斜线条、绘图、表格、数学、化学及其他符号——其表现优于所有商用HTR云API。它已作为商业Web应用的一部分部署于生产环境。
引用
@article{arxiv.2103.06450,
title = {Full Page Handwriting Recognition via Image to Sequence Extraction},
author = {Sumeet S. Singh and Sergey Karayev},
journal= {arXiv preprint arXiv:2103.06450},
year = {2022}
}
备注
Appeared in ICDAR 2021