中文

用 YOLOv5 布局检测揭示文档结构

计算机视觉与模式识别 2023-10-02 v1 机器学习

摘要

当前数字环境的特征在于数据的广泛存在,尤其是非结构化数据,这在金融、医疗和教育等领域带来了诸多问题。传统的数据提取技术在应对非结构化数据固有的多样性和复杂性时遇到困难,因此需要采用更高效的方法。本研究探讨利用前沿计算机视觉模型 YOLOv5 来快速识别文档布局并提取非结构化数据。本文建立了一个将文档相关“对象”概念加以界定的概念框架,纳入段落、表格、图片及其他组成部分等多种元素。主要目标是创建一个能够高效识别文档布局并提取非结构化数据的自主系统,从而提升数据提取效率。在实验中,YOLOv5 模型在文档布局识别任务上表现出显著有效性,达到了高准确率以及精度 0.91、召回率 0.971、F1 分数 0.939 和受试者工作特征曲线下面积(AUC-ROC)0.975。该系统的优异性能优化了从文档图像中提取文本与表格数据的过程。其潜在应用不限于文档分析,还可涵盖来自音频数据等不同来源的非结构化数据。本研究为未来探究 YOLOv5 在管理各类非结构化数据中更广泛适用性的研究奠定基础,为跨多个领域的新型应用提供了可能。

关键词

引用

@article{arxiv.2309.17033,
  title  = {Unveiling Document Structures with YOLOv5 Layout Detection},
  author = {Herman Sugiharto and Yorissa Silviana and Yani Siti Nurpazrin},
  journal= {arXiv preprint arXiv:2309.17033},
  year   = {2023}
}