中文

用于语义版面分析的历时文档数据集

计算机视觉与模式识别 2024-11-18 v1

摘要

我们提出了一个新颖的开放获取数据集,专为语义版面分析设计,旨在通过与文本编码倡议标准的映射来支持文档重建工作流。该数据集包含 7,254 页带标注页面,跨越 1600-2024 年的大时间范围,涵盖数字化和原生数字材料,文档类型多样(杂志、理科和人文学科论文、博士论文、专著、戏剧、行政报告等),并按模块化子集分类。通过纳入不同时期和体裁的内容,它解决了版面复杂度变化和文档结构历史演变的问题。模块化设计允许特定领域的配置。我们在该数据集上评估目标检测模型,考察输入尺寸和基于子集的训练的影响。结果表明,YOLO 的 1280 像素输入尺寸为最优,且在子集上训练通常通过将其纳入通用模型而受益,而非微调预训练权重。

关键词

引用

@article{arxiv.2411.10068,
  title  = {Diachronic Document Dataset for Semantic Layout Analysis},
  author = {Thibault Clérice and Juliette Janes and Hugo Scheithauer and Sarah Bénière and Florian Cafiero and Laurent Romary and Simon Gabay and Benoît Sagot},
  journal= {arXiv preprint arXiv:2411.10068},
  year   = {2024}
}