VTLayout:融合视觉与文本特征的文档版面分析
信息检索
2021-08-31 v1 计算与语言
机器学习
摘要
文档通常包含复杂的物理结构,这使得文档版面分析(DLA)任务具有挑战性。作为内容提取的预处理步骤,DLA有潜力在大规模历史或科学文档中捕获丰富信息。尽管计算机视觉中许多基于深度学习的方法已在检测文档中的\emph{Figure}(图)方面取得优异性能,但在识别DLA中的\emph{List}(列表)、\emph{Table}(表格)、\emph{Text}(文本)和\emph{Title}(标题)类块时仍不尽如人意。本文提出一种VTLayout模型,融合文档的深层次视觉、浅层次视觉和文本特征,以定位并识别不同类别的块。该模型主要包括两个阶段,三种特征提取器构建于第二阶段。在第一阶段,直接应用Cascade Mask R-CNN模型定位文档的所有类别块。在第二阶段,提取深层次视觉、浅层次视觉和文本特征进行融合,以识别文档的类别块。由此,我们在现有定位技术基础上增强了不同类别块的分类能力。实验结果表明,基于PubLayNet数据集,VTLayout的识别能力优于最先进的DLA方法,F1分数高达0.9599。
引用
@article{arxiv.2108.13297,
title = {VTLayout: Fusion of Visual and Text Features for Document Layout Analysis},
author = {Shoubin Li and Xuyan Ma and Shuaiqun Pan and Jun Hu and Lin Shi and Qing Wang},
journal= {arXiv preprint arXiv:2108.13297},
year = {2021}
}