利用字形条件去噪扩散概率模型生成训练样本改进手写体 OCR
计算机视觉与模式识别
2023-06-01 v1
摘要
构建高准确率手写体 OCR 系统需要大量代表性训练数据,而收集这些数据既耗时又昂贵。为缓解该问题,我们提出一种去噪扩散概率模型(DDPM)来生成训练样本。该模型以印刷字形图像为条件,建立印刷字符与手写图像之间的映射,从而能够生成具有多样风格和未见文本内容的照片级真实手写样本。然而,合成图像中的文本内容并非总与字形条件图像一致,导致合成样本标签不可靠。为此,我们进一步提出一种渐进式数据过滤策略,将高正确置信度的样本加入训练集。在 IAM 基准任务上的实验结果表明,使用 DDPM 合成样本增广训练的 OCR 模型相比仅用真实数据训练的模型,词错误率相对降低约 45%。
引用
@article{arxiv.2305.19543,
title = {Improving Handwritten OCR with Training Samples Generated by Glyph Conditional Denoising Diffusion Probabilistic Model},
author = {Haisong Ding and Bozhi Luan and Dongnan Gui and Kai Chen and Qiang Huo},
journal= {arXiv preprint arXiv:2305.19543},
year = {2023}
}