中文

基于合成数据与自标注的无标注深度学习表征词 spotting 方法

计算机视觉与模式识别 2020-05-26 v4

摘要

词 spotting 是支持对历史手写文档集进行初步探索的常用工具。当前性能最优的方法依赖于机器学习技术,需要大量带标注的训练素材。由于应用场景中通常无法获得训练数据,无标注方法旨在没有代表性训练样本的情况下解决检索任务。本工作中,我们提出一种仍采用机器学习技术的无标注方法,因此优于其他无学习的方法。该弱监督训练方案依赖于一部词典,其无需精确匹配数据集。结合基于置信度筛选的伪标注训练样本,我们取得了最先进的按例查询性能。此外,我们的方法支持按串查询,而这通常是其他无标注方法所不具备的。

关键词

引用

@article{arxiv.2003.01989,
  title  = {Annotation-free Learning of Deep Representations for Word Spotting using Synthetic Data and Self Labeling},
  author = {Fabian Wolf and Gernot A. Fink},
  journal= {arXiv preprint arXiv:2003.01989},
  year   = {2020}
}

备注

Accepted to Workshop on Document Analysis Systems (DAS) 2020