中文

揭示过去:分析早期印刷书籍页面的深度学习综合方法

数字图书馆 2025-06-25 v2 计算机视觉与模式识别

摘要

我们开发了一种用于自动分析早期印刷书籍页面结构和内容的概念验证方法。使用 Jagiellonian Digital Library 的资源创建了一个包含 500 页来自五本不同早期印刷书籍的自定义数据集。每页手动标注为五个预定义类别:文本、标题、图片、表格和手稿。此外,还利用了公开的 DocLayNet 数据集作为补充训练数据。为进行对象检测,采用 YOLO11n 和 YOLO11s 模型,并采用两种训练策略:组合数据集 (DocLayNet 和自定义数据集) 以及仅使用自定义数据集。最佳性能 (F1=0.94) 由仅在自定义数据上训练的 YOLO11n 模型实现。随后对被分类为文本的区域进行光学字符识别,使用 Tesseract 和 Kraken OCR,其中 Tesseract 的结果更佳。随后对图片类别应用图像分类,使用 ResNet18 模型,实现 98.7% 的准确率,分为五个子类:装饰性字母、插图、其他、印章和错误检测。此外,还利用 CLIP 模型为插图生成语义描述。结果确认机器学习在早期印刷书籍分析中的潜力,同时强调在 OCR 性能和视觉内容解释方面仍需进一步发展。

关键词

引用

@article{arxiv.2506.18069,
  title  = {Unfolding the Past: A Comprehensive Deep Learning Approach to Analyzing Incunabula Pages},
  author = {Klaudia Ropel and Krzysztof Kutt and Luiz do Valle Miranda and Grzegorz J. Nalepa},
  journal= {arXiv preprint arXiv:2506.18069},
  year   = {2025}
}

备注

10 pages, 8 figures; submitted to TPDL 2025; change in v2: updated e-mail address