中文

数据孵化——合成缺失数据用于手写识别

计算机视觉与模式识别 2021-10-15 v1 机器学习

摘要

在本文中,我们展示了如何利用生成模型通过对内容与风格的控制来构建更好的识别器。我们正基于适量训练样本构建在线手写识别器。通过在相同数据上训练我们的可控手写合成器,我们可以合成此前代表性不足的内容(例如 URL 和电子邮件地址)与风格(例如草写体与斜体)的手写体。此外,我们提出了一个框架来分析由真实与合成训练数据混合训练得到的识别器。我们利用该框架优化数据合成,并展示了相比仅使用真实数据训练的模型,手写识别效果有显著提升。总体而言,我们将字符错误率(Character Error Rate)降低了 66%。

关键词

引用

@article{arxiv.2110.07040,
  title  = {Data Incubation -- Synthesizing Missing Data for Handwriting Recognition},
  author = {Jen-Hao Rick Chang and Martin Bresler and Youssouf Chherawala and Adrien Delaye and Thomas Deselaers and Ryan Dixon and Oncel Tuzel},
  journal= {arXiv preprint arXiv:2110.07040},
  year   = {2021}
}