离线手写文本识别的进展:数据增强与生成技术的系统综述
计算机视觉与模式识别
2025-07-10 v1 人工智能
机器学习
摘要
离线手写文本识别(HTR)系统在历史文件数字化、自动表单处理和生物识别身份验证等应用中发挥着关键作用。然而,其性能常受限于标注训练数据的有限 availability,尤其是针对低资源语言和复杂书法体。本文综述了旨在提高 HTR 系统准确性和鲁棒性的离线手写数据增强和生成技术。我们系统性地检查了传统增强方法以及最新进展,包括生成对抗网络(GAN)、扩散模型和基于转换器的方法。此外,我们探讨了在保持书法真实性和解决数据稀缺性方面,生成多样且真实手写样本的挑战。本次综述遵循 PRISMA 方法论,确保结构化和严格的选取过程。我们的分析始于 1,302 项原始研究,在去除重复项后剩余 848 项,数据来源于 IEEE Digital Library、Springer Link、Science Direct 和 ACM Digital Library 等主要学术来源。通过评估现有数据集、评估指标和最新方法,本综述识别出关键研究空白,提出了未来方向,以推动手写文本生成在多样语言和书法风格领域的发展。
引用
@article{arxiv.2507.06275,
title = {Advancing Offline Handwritten Text Recognition: A Systematic Review of Data Augmentation and Generation Techniques},
author = {Yassin Hussein Rassul and Aram M. Ahmed and Polla Fattah and Bryar A. Hassan and Arwaa W. Abdulkareem and Tarik A. Rashid and Joan Lu},
journal= {arXiv preprint arXiv:2507.06275},
year = {2025}
}