面向合成到真实手写单词识别的无监督自适应
计算机视觉与模式识别
2020-05-28 v2
摘要
手写文本识别(HTR)仍然是一个具有挑战性的问题,因为它必须应对两个重要困难:书写风格之间的变异性,以及标注数据的稀缺性。为缓解此类问题,通常利用合成数据生成与数据增强来训练 HTR 系统。然而,用此类数据训练在真实单词上会产生令人鼓舞但仍不准确的转写。在本文中,我们提出了一种无监督书写者自适应方法,能够自动地将一个完全用合成字体训练得到的通用手写单词识别器,调整至一个新的到来书写者。我们使用五个不同数据集对我们的方案进行了实验验证,涵盖了若干挑战:(i)文档来源:现代与历史样本,可能涉及纸张退化问题;(ii)不同书写风格:单书写者与多书写者集合;以及(iii)语言,涉及不同字符组合。在这些具有挑战性的集合上,我们表明我们的系统能够保持其性能,因此,它提供了一种实用且通用的途径来处理新文档集合,而无需任何昂贵且繁琐的人工标注步骤。
引用
@article{arxiv.1909.08473,
title = {Unsupervised Adaptation for Synthetic-to-Real Handwritten Word Recognition},
author = {Lei Kang and Marçal Rusiñol and Alicia Fornés and Pau Riba and Mauricio Villegas},
journal= {arXiv preprint arXiv:1909.08473},
year = {2020}
}
备注
Accepted to WACV 2020