基于平行文本行图像和自注意力特征距离损失训练 Kindai OCR
计算机视觉与模式识别
2025-08-13 v1
摘要
Kindai 文档是从 19 世纪末至 20 世纪初编写的现代日本文书,对研究该时期社会结构、日常生活和环境条件的研究者具有重要价值。然而,对这些文档进行转录仍然是一项费时费力的任务,导致训练光学字符识别(OCR)系统的注释数据有限。本研究通过利用平行文本行图像——即原始 Kindai 文本及其对应现代日本字体版本的配对图像——来扩充训练数据集。我们引入基于距离的目标函数,以最小化平行图像对的自注意力特征之间的差距。具体而言,我们探索了欧几里得距离和最大均值偏差(MMD)作为领域适应度量。实验结果表明,与基于 Transformer 的 OCR 基线相比,使用欧几里得距离可将字符错误率(CER)降低 2.23%,使用 MMD 可降低 3.94%。此外,我们的方法提高了自注意力表示的判别质量,导致更有效的历史文档 OCR 性能。
关键词
引用
@article{arxiv.2508.08537,
title = {Training Kindai OCR with parallel textline images and self-attention feature distance-based loss},
author = {Anh Le and Asanobu Kitamoto},
journal= {arXiv preprint arXiv:2508.08537},
year = {2025}
}