PP-StructureV2:更强大的文档分析系统
计算机视觉与模式识别
2022-10-14 v2
摘要
大量文档数据以非结构化形式存在,例如没有任何文本信息的原始图像。设计一个实用的文档图像分析系统是一项有意义但具有挑战性的任务。在之前的工作中,我们提出了智能文档分析系统 PP-Structure。为了进一步提升 PP-Structure 的功能和性能,我们在本工作中提出了 PP-StructureV2,它包含两个子系统:版面信息提取和关键信息提取。首先,我们集成了图像方向校正模块和版面恢复模块以增强系统功能。其次,PP-StructureV2 中利用了 8 种实用策略以获得更好的性能。对于版面分析模型,我们引入了超轻量级检测器 PP-PicoDet 和知识蒸馏算法 FGD 进行模型轻量化,在 mAP 相当的情况下将推理速度提升了 11 倍。对于表格识别模型,我们分别利用 PP-LCNet、CSP-PAN 和 SLAHead 优化骨干模块、特征融合模块和解码模块,在推理速度相当的情况下将表格结构准确率提升了 6\%。对于关键信息提取模型,我们引入了独立于视觉特征的 LayoutXLM 架构 VI-LayoutXLM、TB-YX 排序算法和 U-DML 知识蒸馏算法,分别在语义实体识别和关系抽取任务的 Hmean 上带来了 2.8\% 和 9.1\% 的提升。上述所有模型和代码均已在 GitHub 仓库 PaddleOCR 中开源。
引用
@article{arxiv.2210.05391,
title = {PP-StructureV2: A Stronger Document Analysis System},
author = {Chenxia Li and Ruoyu Guo and Jun Zhou and Mengtao An and Yuning Du and Lingfeng Zhu and Yi Liu and Xiaoguang Hu and Dianhai Yu},
journal= {arXiv preprint arXiv:2210.05391},
year = {2022}
}