中文

面向低资源手写文本识别的一次性组合数据生成

计算机视觉与模式识别 2021-10-06 v2

摘要

低资源手写文本识别(Handwritten Text Recognition, HTR)因标注数据稀缺及语言信息(词典与语言模型)极为有限而十分困难。例如历史密码手稿通常使用自创字母表书写以隐藏信息内容。因此,本文通过一种基于贝叶斯程序学习(Bayesian Program Learning, BPL)的数据生成技术来解决该问题。与传统需要大量标注图像的生成方法不同,我们的方法仅使用字母表中每个符号的一个样本即可生成类人手写。生成符号后,我们创建合成文本行,以无分割方式训练最先进的HTR架构。定量与定性分析均证实所提方法的有效性。

关键词

引用

@article{arxiv.2105.05300,
  title  = {One-shot Compositional Data Generation for Low Resource Handwritten Text Recognition},
  author = {Mohamed Ali Souibgui and Ali Furkan Biten and Sounak Dey and Alicia Fornés and Yousri Kessentini and Lluis Gomez and Dimosthenis Karatzas and Josep Lladós},
  journal= {arXiv preprint arXiv:2105.05300},
  year   = {2021}
}

备注

Accepted in WACV 2022