Doc-GCN:面向文档布局分析的异构图卷积网络
计算机视觉与模式识别
2022-09-20 v2 机器学习
摘要
在将非结构化数字文档解析为结构化、机器可读格式以供下游应用时,识别其布局至关重要。近期文档布局分析研究通常依赖计算机视觉模型理解文档,却忽略了上下文信息或文档组件间关系等关键信息。我们的 Doc-GCN 提出了一种协调并整合文档布局分析中异质要素的有效方法。我们首先构建图以显式描述句法、语义、密度及外观/视觉信息这四个主要方面。随后,应用图卷积网络表征各方面信息并利用池化进行整合。最后,聚合各方面特征并输入两层 MLP 以完成文档布局组件分类。我们的 Doc-GCN 在三个广泛使用的 DLA 数据集上取得了新的 SOTA 结果。
引用
@article{arxiv.2208.10970,
title = {Doc-GCN: Heterogeneous Graph Convolutional Networks for Document Layout Analysis},
author = {Siwen Luo and Yihao Ding and Siqu Long and Josiah Poon and Soyeon Caren Han},
journal= {arXiv preprint arXiv:2208.10970},
year = {2022}
}
备注
Accepted by COLING 2022