中文

RanLayNet:用于领域适应与泛化的文档布局检测数据集

计算机视觉与模式识别 2024-04-22 v2 人工智能

摘要

大型真实标注数据集和深度学习技术的最新进展对布局检测起到了推动作用。然而,由于这些数据集的布局多样性受限,对其进行训练需要大量标注样本,这既昂贵又耗时。因此,源域和目标域之间的差异可能会显著影响这些模型的功能。为了解决这个问题,已经开发了领域适应方法,该方法使用少量标记数据将模型调整到目标域。在本研究中,我们引入了一个名为 RanLayNet 的合成文档数据集,其中丰富了自动分配的标签,表示布局元素的空间位置、范围和类型。这项工作的主要目标是开发一个多功能的数据集,能够训练具有鲁棒性和适应不同文档格式能力的模型。通过经验实验,我们证明了在我们的数据集上训练的深度布局识别模型比仅在真实文档上训练的模型表现出更好的性能。此外,我们通过在 Doclaynet 数据集上使用 PubLayNet 和 IIIT-AR-13K 数据集微调推理模型进行了比较分析。我们的发现强调,使用我们的数据集增强的模型对于科学文档领域中 TABLE 类取得 0.398 和 0.588 mAP95 分数等任务是最优的。

关键词

引用

@article{arxiv.2404.09530,
  title  = {RanLayNet: A Dataset for Document Layout Detection used for Domain Adaptation and Generalization},
  author = {Avinash Anand and Raj Jaiswal and Mohit Gupta and Siddhesh S Bangar and Pijush Bhuyan and Naman Lal and Rajeev Singh and Ritika Jha and Rajiv Ratn Shah and Shin'ichi Satoh},
  journal= {arXiv preprint arXiv:2404.09530},
  year   = {2024}
}

备注

8 pages, 6 figures, MMAsia 2023 Proceedings of the 5th ACM International Conference on Multimedia in Asia