中文

混合光栅与矢量 PDF 的图形及图注提取:基于 OCR 特征的天文文献数字化

天体物理仪器与方法 2022-09-13 v1 数字图书馆

摘要

在 1990 年代末数字化时代之前发表的科学文章包含“被困”在其扫描页面中的图形。尽管在提取图形及其图注方面已取得进展,但目前尚无稳健的方法用于此过程。我们提出了一种基于 YOLO 的方法,用于扫描页面、光学字符识别(OCR)之后,其同时使用灰度图和 OCR 特征。当应用于天体物理数据系统(ADS)的天体物理学文献馆藏时,我们发现图形(图注)的 F1 分数分别为 90.9%(92.2%),交并比(IOU)截断为 0.9,这相比其他最先进的方法有显著改进。

关键词

引用

@article{arxiv.2209.04460,
  title  = {Figure and Figure Caption Extraction for Mixed Raster and Vector PDFs: Digitization of Astronomical Literature with OCR Features},
  author = {J. P. Naiman and Peter K. G. Williams and Alyssa Goodman},
  journal= {arXiv preprint arXiv:2209.04460},
  year   = {2022}
}

备注

16 pages, 3 figures, accepted to TPDL 2022