中文

基于去噪扩散概率模型的手写汉字识别训练数据零样本生成

计算机视觉与模式识别 2023-05-26 v1

摘要

汉字类别超过8万,其中大多数极少使用。若采用传统方法构建支持全字符集的高性能手写汉字识别(HCCR)系统,需为每个字符类别收集大量训练样本,既耗时又昂贵。本文提出一种新方法,利用去噪扩散概率模型(DDPM)将字体库生成的中文字形图像转换为手写体图像。DDPM从小规模字符集的手写样本中学习后,能够将印刷笔画映射为手写笔画,从而可为未见过的字符类别生成逼真且风格多样的手写样本。将DDPM合成的未见类别样本与其他类别的真实样本结合,即可构建支持全字符集的HCCR系统。在包含3,755个字符类别的CASIA-HWDB数据集上的实验结果表明,使用合成样本训练的HCCR系统在识别精度上与使用真实样本训练的系统表现相近。所提方法有望解决更大词表下的HCCR问题。

关键词

引用

@article{arxiv.2305.15660,
  title  = {Zero-shot Generation of Training Data with Denoising Diffusion Probabilistic Model for Handwritten Chinese Character Recognition},
  author = {Dongnan Gui and Kai Chen and Haisong Ding and Qiang Huo},
  journal= {arXiv preprint arXiv:2305.15660},
  year   = {2023}
}