中文

基于平行文本行图像和自注意力特征距离损失训练 Kindai OCR

计算机视觉与模式识别 2025-08-13 v1

摘要

Kindai 文档是从 19 世纪末至 20 世纪初编写的现代日本文书,对研究该时期社会结构、日常生活和环境条件的研究者具有重要价值。然而,对这些文档进行转录仍然是一项费时费力的任务,导致训练光学字符识别(OCR)系统的注释数据有限。本研究通过利用平行文本行图像——即原始 Kindai 文本及其对应现代日本字体版本的配对图像——来扩充训练数据集。我们引入基于距离的目标函数,以最小化平行图像对的自注意力特征之间的差距。具体而言,我们探索了欧几里得距离和最大均值偏差(MMD)作为领域适应度量。实验结果表明,与基于 Transformer 的 OCR 基线相比,使用欧几里得距离可将字符错误率(CER)降低 2.23%,使用 MMD 可降低 3.94%。此外,我们的方法提高了自注意力表示的判别质量,导致更有效的历史文档 OCR 性能。

关键词

引用

@article{arxiv.2508.08537,
  title  = {Training Kindai OCR with parallel textline images and self-attention feature distance-based loss},
  author = {Anh Le and Asanobu Kitamoto},
  journal= {arXiv preprint arXiv:2508.08537},
  year   = {2025}
}