RoundTripOCR:用于增强低资源梵文语言后 OCR 纠错的数据生成技术
计算与语言
2025-02-25 v2 计算机视觉与模式识别
摘要
光学字符识别(OCR)技术已彻底革新了印刷文本的数字化,使其能够高效地在各类领域中实现数据提取和分析。正如机器翻译系统一样,OCR 系统也容易出错。本文针对数据生成和后 OCR 纠错,特别针对低资源语言提出了挑战。我们提出了一种用于梵文语言的合成数据生成方法,RoundTripOCR,以解决低资源语言后 OCR 纠错数据稀缺的难题。我们发布了针对印地语、马拉拉语、博多语、尼泊尔语、孟加拉语和梵语的后 OCR 文本纠正数据集。我们还提出了一种新颖的 OCR 纠错方法,通过利用机器翻译技术来实现。该方法将 OCR 错误视为平行文本语料库中的错误翻译,采用预训练的变换器模型学习从错误文本对到正确文本对的映射,从而有效纠正 OCR 错误。
引用
@article{arxiv.2412.15248,
title = {RoundTripOCR: A Data Generation Technique for Enhancing Post-OCR Error Correction in Low-Resource Devanagari Languages},
author = {Harshvivek Kashid and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2412.15248},
year = {2025}
}
备注
Proceedings of the 21st International Conference on Natural Language Processing (ICON)