中文

从编码学到代码:Transformer 与 YOLO 基检测器在历史文件布局分析中的比较研究

计算机视觉与模式识别 2025-06-26 v1 计算与语言 数据库

摘要

鲁棒的文件布局分析 (DLA) 对自动化处理和理解具有复杂页面组织的历史文档至关重要。本文对五种最新对象检测架构在三个标注数据集上进行基准测试,这些数据集代表了编码学复杂性的不同范围:e-NDP,巴黎中世纪登记簿(1326-1504);CATMuS,来自 various 中世纪和现代来源(约12至17世纪)的多类数据集;HORAE,装饰性仪书(约13至16世纪)的语料库。我们评估两种基于 Transformer 的模型(Co-DETR、Grounding DINO)与三个 YOLO 变体(AABB、OBB 和 YOLO-World)。我们的发现显示,模型架构、数据集特征以及边界框表示方式对性能有显著影响。在 e-NDP 数据集上,Co-DETR 实现了最佳结果(0.752 [email protected]:.95),紧随其后的是 YOLOv11X-OBB(0.721)。相反,在更复杂的 CATMuS 和 HORAE 数据集上,基于 CNN 的 YOLOv11x-OBB 大幅超越所有其他模型(分别为 0.564 和 0.568)。本研究无疑表明,使用倾斜边界框 (OBB) 并非微小的改进,而是准确建模历史手稿非笛卡尔特性的根本要求。我们得出结论,在结构化布局方面具有全局上下文感知能力的 Transformer 与在视觉上更为多样和复杂的文档中表现出优异泛化能力的 CNN-OBB 模型之间存在关键权衡。

关键词

引用

@article{arxiv.2506.20326,
  title  = {From Codicology to Code: A Comparative Study of Transformer and YOLO-based Detectors for Layout Analysis in Historical Documents},
  author = {Sergio Torres Aguilar},
  journal= {arXiv preprint arXiv:2506.20326},
  year   = {2025}
}