基于 Detectron2 的孟加拉语文档版面分析
计算机视觉与模式识别
2023-08-29 v1 机器学习
摘要
文档数字化对于保存历史记录、高效的文档管理以及推进 OCR(光学字符识别)研究至关重要。文档版面分析(DLA)涉及将文档分割为文本框、段落、图像和表格等有意义的单元。在处理多样版面、历史文档以及如孟加拉语等独特文字时,由于缺乏全面的孟加拉语 DLA 数据集,挑战随之产生。我们利用 Detectron2 库中先进的 Mask R-CNN 模型提升了孟加拉语文档 DLA 模型的准确性。我们的评估涉及三种变体:Mask R-CNN R-50、R-101 和 X-101,均使用及未使用来自 PubLayNet 的预训练权重,在 BaDLAD 数据集上测试;该数据集包含人工标注的孟加拉语文档,分为文本框、段落、图像和表格四类。结果显示了这些模型在准确分割孟加拉语文档上的有效性。我们讨论了速度-精度权衡并强调了预训练权重的重要性。我们的发现拓展了 Mask R-CNN 在文档版面分析、高效文档管理和 OCR 研究中的适用性,同时提出了微调与数据增强的未来方向。
引用
@article{arxiv.2308.13769,
title = {Bengali Document Layout Analysis with Detectron2},
author = {Md Ataullha and Mahedi Hassan Rabby and Mushfiqur Rahman and Tahsina Bintay Azam},
journal= {arXiv preprint arXiv:2308.13769},
year = {2023}
}
备注
DL Sprint 2.0 - BUET CSE Fest 2023, 4 pages, 2 figures, 2 tables