中文

基于 Mask R-CNN 提升孟加拉语文档版面分析性能

计算机视觉与模式识别 2023-08-23 v2 人工智能 机器学习

摘要

理解数字文档如同解谜,尤其是历史文档。文档版面分析(DLA)通过将文档划分为段落、图像和表格等区域来辅助解决这一难题。这对于机器读取和理解这些文档至关重要。在 DL Sprint 2.0 竞赛中,我们致力于理解 Bangla(孟加拉语)文档。我们使用了一个名为 BaDLAD 的包含大量样本的数据集。我们训练了一个名为 Mask R-CNN 的特殊模型来辅助这种理解。我们通过逐步的超参数调优改进了该模型,并取得了 0.889 的良好 dice 分数。然而,并非一切顺利。我们尝试使用一个为英文文档训练的模型,但它并不适用于孟加拉语。这向我们表明每种语言都有其自身的挑战。我们在 DL Sprint 2.0 中的解决方案已公开于 https://www.kaggle.com/competitions/dlsprint2/discussion/432201,同时提供了 notebooks、权重和推理 notebook。

关键词

引用

@article{arxiv.2308.10511,
  title  = {Performance Enhancement Leveraging Mask-RCNN on Bengali Document Layout Analysis},
  author = {Shrestha Datta and Md Adith Mollah and Raisa Fairooz and Tariful Islam Fahim},
  journal= {arXiv preprint arXiv:2308.10511},
  year   = {2023}
}

备注

Contest paper, Conest: DL sprint 2.0 (Link: https://www.kaggle.com/competitions/dlsprint2), Solution link: https://www.kaggle.com/competitions/dlsprint2/discussion/432201