中文

古希腊文献批注版本的结构感知文本识别

计算机视觉与模式识别 2026-05-29 v2

摘要

近年来,视觉语言模型(VLM)的快速发展彻底变革了文档理解的端到端方法。然而,这些模型在解释历史学术文本中复杂的布局语义方面的能力仍受限。本文探讨古希腊文献批注版本的结构感知文本识别问题,这类文本具有密集的参考层级结构和 extensive 的边缘注释。我们引入了两个新型资源:(i)来自 TEI/XML 来源生成的、具有受控排版与布局变异的大规模人造语料库,规模达 18.5 万页图像;(ii)涵盖一个多世纪编辑与排版实践的精选真实扫描版图基准数据集。通过这些数据集,我们在零样本与微调两个实验设置下,对评估了三种最新的 VLM。我们的实验结果表明,当面对高度结构化的历史文档时,当前 VLM 架构存在显著局限。零样本设置下,大多数模型的表现显著低于已有的成熟方案。然而,Qwen3VL-8B 模型实现了最佳性能,在真实扫描版上达到 1.0% 的中位数字符错误率(CER)。这些结果既凸显了当前 VLM 在复杂学术文档结构感知识别方面的不足,也揭示了其潜在的发展前景。

关键词

引用

@article{arxiv.2603.02803,
  title  = {Structure-Aware Text Recognition for Ancient Greek Critical Editions},
  author = {Nicolas Angleraud and Antonia Karamolegkou and Benoît Sagot and Thibault Clérice},
  journal= {arXiv preprint arXiv:2603.02803},
  year   = {2026}
}