中文

基于 BaDLAD 数据集的文档布局分析:一种全面的 MViTv2 方法

计算机视觉与模式识别 2023-09-01 v1 机器学习

摘要

在快速发展的数字时代,文档布局分析在自动化信息提取与解读中起着关键作用。在我们的工作中,我们在 BaDLAD 数据集上训练了带级联 mask R-CNN 的 MViTv2 transformer 模型架构,以从文档中提取文本框、段落、图像和表格。在 3 阶段循环中于 20365 张文档图像上训练 36 个 epoch 后,我们实现了 0.2125 的训练损失和 0.19 的掩码损失。我们的工作超越训练,深入探索潜在的增强途径。我们研究了旋转和翻转增强的影响、推理前切片输入图像的有效性、改变 transformer 主干分辨率的含义,以及采用双遍推理以发现遗漏文本框的潜力。通过这些探索,我们观察到一系列结果,其中某些修改带来切实的性能提升,而其他则对未来工作提供了独特见解。

关键词

引用

@article{arxiv.2308.16571,
  title  = {Document Layout Analysis on BaDLAD Dataset: A Comprehensive MViTv2 Based Approach},
  author = {Ashrafur Rahman Khan and Asif Azad},
  journal= {arXiv preprint arXiv:2308.16571},
  year   = {2023}
}