中文

AnnoPage 数据集:带有细粒度分类的文档非文本元素数据集

计算机视觉与模式识别 2025-07-17 v3 人工智能 机器学习

摘要

我们介绍AnnoPage数据集,这是一个新型的7,550页历史文档集合,主要包含在1485年至今的墨西哥和德国文献中,聚焦于19世纪末至20世纪初。该数据集旨在支持文档布局分析和目标检测研究。每页文档都用轴对齐边界框(AABB)标注,表示25类非文本元素的类别,如图像、地图、装饰元素或图表,遵循捷克文档图像处理方法论。标注由专家图书馆员创建,以确保准确性和一致性。数据集还整合了来自多个主要历史文档数据集的页面,以增强可变性并保持连续性。数据集分为开发和测试子集,其中测试集经过精心挑选,以保持类别分布。我们提供了使用YOLO和DETR目标检测器的基线结果,为未来研究提供参考点。AnnoPage数据集已公开于Zenodo(https://doi.org/10.5281/zenodo.12788419),并附有以YOLO格式提供的ground-truth标注。

关键词

引用

@article{arxiv.2503.22526,
  title  = {AnnoPage Dataset: Dataset of Non-Textual Elements in Documents with Fine-Grained Categorization},
  author = {Martin Kišš and Michal Hradiš and Martina Dvořáková and Václav Jiroušek and Filip Kersch},
  journal= {arXiv preprint arXiv:2503.22526},
  year   = {2025}
}

备注

17 pages, 2 tables, 7 figures; Accepted to GREC Workshop at ICDAR2025