中文

ScanBank:用于扫描版电子学位论文中图形提取的基准数据集

计算机视觉与模式识别 2021-06-30 v1 数字图书馆 机器学习

摘要

我们关注电子学位论文 (ETD),旨在改善其获取途径并拓展其用途,因为已有超过 600 万篇公开可用,且它们构成了辅助跨学科研究与教育的重要语料库。随着原生数字文档的加入,该语料库不断增长,同时数百万篇较旧的学位论文已被转换为数字形式,以便在机构知识库中电子传播。在 ETD 中,与其他学术著作一样,图形和表格能以简洁方式传达大量信息。尽管已有方法被提出用于从原生数字 PDF 中提取图形和表格,但它们在扫描版 ETD 上表现不佳。考虑到这一问题,我们对最先进图形提取系统的评估认为,它们在扫描版 PDF 上表现不佳的原因是仅使用原生数字文档进行了训练。为应对这一局限,我们提出 ScanBank,一个包含 1 万张扫描页面图像的新数据集,由人工标注其中存在的 3300 个图形或表格。我们使用该数据集训练基于 YOLOv5 的深度神经网络模型,以准确提取扫描版 ETD 中的图形和表格。我们提出并回答了旨在寻找更好扫描文档图形提取方法的重要研究问题。其中之一涉及应用于原生数字文档的数据增强技术对于训练的价值,这些技术用于训练更适用于扫描文档图形提取的模型。据我们所知,ScanBank 是首个用于扫描版 ETD 图形与表格提取的人工标注数据集。在 ScanBank 上训练的基于 YOLOv5 的模型以显著优势优于现有的可比较的开源且免费可用的基线方法。

关键词

引用

@article{arxiv.2106.15320,
  title  = {ScanBank: A Benchmark Dataset for Figure Extraction from Scanned Electronic Theses and Dissertations},
  author = {Sampanna Yashwant Kahu and William A. Ingram and Edward A. Fox and Jian Wu},
  journal= {arXiv preprint arXiv:2106.15320},
  year   = {2021}
}

备注

16 pages, 3 figures, submitted to ACM/IEEE Joint Conference on Digital Libraries