一种用于端到端多语言 OCR 的多路复用网络
计算机视觉与模式识别
2021-03-31 v1
摘要
OCR 的近期进展表明,包含检测与识别的端到端(E2E)训练流程可带来最佳结果。然而,许多现有方法主要关注拉丁字母语言,常常甚至仅限大小写不敏感的英文字符。本文中,我们提出一种 E2E 方法——多路复用多语言 Mask TextSpotter,其在词级别进行文字系统识别,并以不同识别头处理不同文字系统,同时保持统一损失以同时优化文字系统识别与多个识别头。实验表明,在参数数量相近的情况下,我们的方法在端到端识别任务上优于单头模型,并在 MLT17 与 MLT19 联合文本检测与文字系统识别基准上取得当前最优结果。我们相信,我们的工作是迈向端到端可训练且可扩展的多语言多用途 OCR 系统的一步。我们的代码与模型将公开。
引用
@article{arxiv.2103.15992,
title = {A Multiplexed Network for End-to-End, Multilingual OCR},
author = {Jing Huang and Guan Pang and Rama Kovvuri and Mandy Toh and Kevin J Liang and Praveen Krishnan and Xi Yin and Tal Hassner},
journal= {arXiv preprint arXiv:2103.15992},
year = {2021}
}