历史报纸 OCR 的状态空间模型 vs. Transformer 与 BiLSTM 模型基准测试
摘要
历史报纸的端到端 OCR 仍然具有挑战性,因为模型必须处理长文本序列、降解的印刷质量以及复杂的版面布局。虽然 Transformer-based 的识别器在当前研究中占据主导地位,但其二次复杂度限制了高效的段落级转录和大规模部署。我们研究线性时间状态空间模型(SSMs), specifically Mamba,作为 Transformer-based 序列建模的可扩展替代方案用于 OCR。我们据此了解,首个基于 SSMs 的 OCR 架构,将 CNN 视觉编码器与双向和自回归 Mamba 序列建模相结合,并进行了大规模基准测试,将 SSMs 与 Transformer- 和 BiLSTM-based 识别器进行比较。在相同训练条件下评估了多个解码策略(CTC、自回归和非自回归),并在强大神经基线(VAN、DAN、DANIEL)和广泛使用的离线 OCR 引擎(PERO-OCR、Tesseract OCR、TrOCR、Gemini)之间进行比较。实验在 Bibliothèque nationale du Luxembourg 上新发布的>99% 验证的金标准注释以及对 Fraktur 和 Antiqua 行的跨数据集测试中进行,结果显示所有神经模型均实现低误差率(约 2% CER),使计算效率成为主要区分因素。Mamba-based 模型在保持竞争精度的同时将推理时间缩短一半,并在内存规模上表现出优势(在 1000 个字符处分别为 1.26x vs 2.30x 增长),在 severely 降解的段落级别达到 6.07% CER,而 DAN 为 5.24%,同时快 2.05 倍。我们发布代码、训练好的模型和标准化评估协议,以启用可重复研究并指导从业者在大规模文化遗产 OCR 中进行操作。
关键词
引用
@article{arxiv.2604.00725,
title = {A Benchmark of State-Space Models vs. Transformers and BiLSTM-based Models for Historical Newspaper OCR},
author = {Merveilles Agbeti-messan and Thierry Paquet and Clément Chatelain and Pierrick Tranouez and Stéphane Nicolas},
journal= {arXiv preprint arXiv:2604.00725},
year = {2026}
}