LayoutParser:基于深度学习的文档图像分析统一工具包
计算机视觉与模式识别
2021-06-22 v2 人工智能
摘要
文档图像分析(DIA)的近期进展主要由神经网络的应用所驱动。理想情况下,研究成果可轻松部署于生产并扩展以供进一步研究。然而,诸如代码库组织松散和模型配置复杂等因素,使广大受众难以轻松复用重要创新。尽管在自然语言处理和计算机视觉等领域已有持续努力来改善复用性并简化深度学习(DL)模型开发,但它们均未针对DIA领域的挑战进行优化。这代表了现有工具包中的一大空白,因为DIA是社会科学与人文众多学科中学术研究的核心。本文介绍layoutparser,一个用于简化DIA研究与应用中的DL使用的开源库。layoutparser核心库提供一组简单直观的接口,用于应用和定制DL模型以进行版面检测、字符识别及许多其他文档处理任务。为促进可扩展性,layoutparser还集成了一个社区平台,用于共享预训练模型和完整的文档数字化流水线。我们展示了layoutparser在真实用例中对轻量和大规模数字化流水线均有助益。该库公开于 https://layout-parser.github.io/。
引用
@article{arxiv.2103.15348,
title = {LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis},
author = {Zejiang Shen and Ruochen Zhang and Melissa Dell and Benjamin Charles Germain Lee and Jacob Carlson and Weining Li},
journal= {arXiv preprint arXiv:2103.15348},
year = {2021}
}
备注
Accepted at ICDAR 2021, 16 pages, 6 figures, 2 tables