面向低资源手写文本识别的一次性组合数据生成
计算机视觉与模式识别
2021-10-06 v2
摘要
低资源手写文本识别(Handwritten Text Recognition, HTR)因标注数据稀缺及语言信息(词典与语言模型)极为有限而十分困难。例如历史密码手稿通常使用自创字母表书写以隐藏信息内容。因此,本文通过一种基于贝叶斯程序学习(Bayesian Program Learning, BPL)的数据生成技术来解决该问题。与传统需要大量标注图像的生成方法不同,我们的方法仅使用字母表中每个符号的一个样本即可生成类人手写。生成符号后,我们创建合成文本行,以无分割方式训练最先进的HTR架构。定量与定性分析均证实所提方法的有效性。
引用
@article{arxiv.2105.05300,
title = {One-shot Compositional Data Generation for Low Resource Handwritten Text Recognition},
author = {Mohamed Ali Souibgui and Ali Furkan Biten and Sounak Dey and Alicia Fornés and Yousri Kessentini and Lluis Gomez and Dimosthenis Karatzas and Josep Lladós},
journal= {arXiv preprint arXiv:2105.05300},
year = {2021}
}
备注
Accepted in WACV 2022