AnnoPage 数据集:带有细粒度分类的文档非文本元素数据集
计算机视觉与模式识别
2025-07-17 v3 人工智能
机器学习
摘要
我们介绍AnnoPage数据集,这是一个新型的7,550页历史文档集合,主要包含在1485年至今的墨西哥和德国文献中,聚焦于19世纪末至20世纪初。该数据集旨在支持文档布局分析和目标检测研究。每页文档都用轴对齐边界框(AABB)标注,表示25类非文本元素的类别,如图像、地图、装饰元素或图表,遵循捷克文档图像处理方法论。标注由专家图书馆员创建,以确保准确性和一致性。数据集还整合了来自多个主要历史文档数据集的页面,以增强可变性并保持连续性。数据集分为开发和测试子集,其中测试集经过精心挑选,以保持类别分布。我们提供了使用YOLO和DETR目标检测器的基线结果,为未来研究提供参考点。AnnoPage数据集已公开于Zenodo(https://doi.org/10.5281/zenodo.12788419),并附有以YOLO格式提供的ground-truth标注。
引用
@article{arxiv.2503.22526,
title = {AnnoPage Dataset: Dataset of Non-Textual Elements in Documents with Fine-Grained Categorization},
author = {Martin Kišš and Michal Hradiš and Martina Dvořáková and Václav Jiroušek and Filip Kersch},
journal= {arXiv preprint arXiv:2503.22526},
year = {2025}
}
备注
17 pages, 2 tables, 7 figures; Accepted to GREC Workshop at ICDAR2025