中文

多语言历史文本 OCR 的改进

计算机视觉与模式识别 2025-08-15 v1 计算与语言

摘要

本文呈现我们在光学字符识别(OCR)和文档布局分析中使用先进深度学习技术的 methodology 与发现。首先,针对死海古卷的希伯来文碎片,我们通过广泛的数据增强来增强数据集,并采用 Kraken 和 TrOCR 模型提高字符识别。在分析 16 至 18 世纪的会议决议文本时,我们利用集成深度学习分割(DeepLabV3+)与双向 LSTM 的卷积循环神经网络(CRNN),并采用基于置信度的伪标签方法来细化模型。最后,针对现代英文字体手写体识别任务,我们应用带有 ResNet34 编码器的 CRNN,使用连接式时序分类(CTC)损失函数有效捕获序列依赖关系。本报告提供了宝贵的见解,并为未来研究指明了潜在方向。

关键词

引用

@article{arxiv.2508.10356,
  title  = {Improving OCR for Historical Texts of Multiple Languages},
  author = {Hylke Westerdijk and Ben Blankenborg and Khondoker Ittehadul Islam},
  journal= {arXiv preprint arXiv:2508.10356},
  year   = {2025}
}