基于先验的高分辨率分层语义分割的文档结构提取
计算机视觉与模式识别
2020-09-18 v2
摘要
由于文档图像结构提取对广泛的实际应用具有重大影响,该问题一直是长期的研究课题。在本文中,我们分享了采用分层语义分割网络执行该结构提取任务的发现。我们提出了一种基于先验的深度分层 CNN 网络架构,能够利用非常高分辨率(1800 x 1000)的图像进行文档结构提取。我们将文档图像划分为重叠的水平条带,使网络对一条带进行分割并将其预测掩码作为先验,用于预测后续条带的分割。我们通过消融实验以及与低分辨率变体的对比,验证了基于条带的网络架构的有效性。此外,为展示我们网络的能力,我们仅在某一种文档(表单)上训练,并在其他通用文档数据集上取得了最先进(state-of-the-art)的结果。我们引入了新的人工标注表单数据集,并表明我们的方法在该数据集上提取分层结构时显著优于不同的分割基线。我们的方法目前正应用于 Adobe 的 AEM Forms 中,用于自动将纸质和 PDF 表单转换为基于现代 HTML 的表单。
引用
@article{arxiv.1911.12170,
title = {Document Structure Extraction using Prior based High Resolution Hierarchical Semantic Segmentation},
author = {Mausoom Sarkar and Milan Aggarwal and Arneh Jain and Hiresh Gupta and Balaji Krishnamurthy},
journal= {arXiv preprint arXiv:1911.12170},
year = {2020}
}
备注
This work has been accepted at ECCV 2020