中文

基于实例分割的历史藏文文档精确细粒度版面分析

计算机视觉与模式识别 2024-10-28 v3

摘要

无需后续文本行分割的精确版面分析仍是一项持续挑战,尤其面对具有大量粘连成分和斑驳背景的一类历史藏文文档《甘珠尔》时。旨在识别文档图像中不同区域的版面分析,对于字符识别等后续流程不可或缺。然而,此前仅有少量研究进行行级版面分析,未能处理《甘珠尔》。为获得最优结果,我们提出一种细粒度的子行级版面分析方法。首先,我们引入一种动态且可靠的加速方法来构建数据集。其次,针对《甘珠尔》的特点对 SOLOv2 进行了增强。然后,我们在训练阶段将增强后的 SOLOv2 与准备好的标注文件一同输入。网络训练完成后,在推理阶段可对文本行、句子和标题的实例进行分割与识别。实验结果表明,所提方法在我们的数据集上取得了可观的 72.7% 平均精度。总体而言,该初步研究为细粒度子行级版面分析提供了见解,并验证了基于 SOLOv2 的方法。我们也相信所提方法可应用于具有各种版式的其他语言文档。

关键词

引用

@article{arxiv.2110.08164,
  title  = {Accurate Fine-grained Layout Analysis for the Historical Tibetan Document Based on the Instance Segmentation},
  author = {Penghai Zhao and Weilan Wang and Zhengqi Cai and Guowei Zhang and Yuqi Lu},
  journal= {arXiv preprint arXiv:2110.08164},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication