中文

AT-ST:面向有限转写文本领域的 OCR 自训练自适应策略

计算机视觉与模式识别 2022-01-26 v1

摘要

本文通过一种简单的自训练策略解决有限人工标注领域的文本识别问题。当目标领域数据充足时(例如转写某人的一批信函或大型手稿),我们的方法应能减少人工标注工作量。我们提出在来自相关领域的大规模数据与来自目标领域的可用标注数据混合集上训练种子系统。该种子系统转写目标领域的未标注数据,随后用于训练一个更优的系统。我们研究了若干置信度度量,最终决定采用转写文本的后验概率进行数据筛选。此外,我们提出使用一种激进的掩码方案来增强数据。通过自训练,我们在手写数据上实现了高达 55% 的字符错误率下降,在印刷数据上达 38%。掩码增强本身将错误率降低约 10%,且其效果在困难的手写数据情况下更为显著。

关键词

引用

@article{arxiv.2104.13037,
  title  = {AT-ST: Self-Training Adaptation Strategy for OCR in Domains with Limited Transcriptions},
  author = {Martin Kišš and Karel Beneš and Michal Hradiš},
  journal= {arXiv preprint arXiv:2104.13037},
  year   = {2022}
}

备注

15 pages, 6 figures, 5 tables