CDeC-Net:用于文档图像表格检测的复合可变形级联网络
计算机视觉与模式识别
2020-08-26 v1
摘要
定位页面元素/对象(如表格、图形、公式等)是从文档图像中提取信息的首要步骤。我们提出了一种新颖的端到端可训练深度网络(CDeC-Net)用于检测文档中存在的表格。所提网络由 Mask R-CNN 的多阶段扩展构成,具有带可变形卷积的双骨干网络,用于以高检测精度在较高 IoU 阈值下检测不同尺度的表格。我们在所有公开可用的基准数据集——ICDAR-2013、ICDAR-2017、ICDAR-2019、UNLV、Marmot、PubLayNet 和 TableBank——上通过大量实验对 CDeC-Net 进行了实证评估。我们的方案具有三个重要特性:(i)单一训练模型 CDeC-Net{\ddag} 在所有流行基准数据集上均表现良好;(ii)我们在多个(包括较高的)IoU 阈值上报告了优异性能;(iii)遵循近期论文对每个基准的相同协议,我们持续展示了更优的定量性能。我们的代码和模型将公开发布以实现结果可复现。
引用
@article{arxiv.2008.10831,
title = {CDeC-Net: Composite Deformable Cascade Network for Table Detection in Document Images},
author = {Madhav Agarwal and Ajoy Mondal and C. V. Jawahar},
journal= {arXiv preprint arXiv:2008.10831},
year = {2020}
}
备注
12