BiblioPage:用于从扫描标题页提取图书元数据的数据集
计算机视觉与模式识别
2025-03-26 v1 人工智能
机器学习
摘要
手动数字化图书元数据耗时且费力,尤其是对于格式高度可变的历史档案和实际场景下的档案库而言。尽管机器学习技术取得了进展,但缺乏专门针对元数据提取任务的数据集仍制约了自动化进程。为填补这一空白,我们引入 BiblioPage 数据集,包含约 2,000 份单册标题页,源自 14 座捷克图书馆,涵盖广泛的出版时期、排版风格与版面结构。每页标题页均标注了 16 项图书属性,包括标题、作者及出版元数据,并提供 precisely 的边界框位置信息。为从该数据集中提取结构化信息,我们评估了 YOLO 与 DETR 等目标检测模型结合基于 Transformer 的 OCR,最高可达 52 的 mAP 和 59 的 F1 分数。此外,我们还考察了各种视觉大语言模型,包括 LlamA 3.2-Vision 与 GPT-4o,最佳模型达到 67 的 F1 分数。BiblioPage 为图书元数据提取提供了真实世界的基准,推动了文档理解、文档问答及文档信息提取等任务的发展。数据集与评估脚本已于 GitHub 上公开:https://github.com/DCGM/biblio-dataset
引用
@article{arxiv.2503.19658,
title = {BiblioPage: A Dataset of Scanned Title Pages for Bibliographic Metadata Extraction},
author = {Jan Kohút and Martin Dočekal and Michal Hradiš and Marek Vaško},
journal= {arXiv preprint arXiv:2503.19658},
year = {2025}
}
备注
Submitted to ICDAR2025 conference