中文

在有限手写文本上自回归模型的实用微调

计算机视觉与模式识别 2025-03-26 v1

摘要

OCR 应用的一个常见使用场景是:用户上传文档,并逐步修正自动识别结果以获得最终转录文本。这一修正阶段为 OCR 模型的渐进式自适应提供了机会,因此尽早进行自适应至关重要,同时还需保证稳定性和可靠性。我们证明,当前最先进的基于 Transformer 的模型能够有效支持这种自适应,从而逐步减轻标注者的工作负担。我们的结果表明,仅用 16 行文本即可可靠地启动微调,使字符错误率(CER)获得 10% 的相对改进,并在 256 行时改进幅度可扩展至 40%。我们进一步研究了模型各组件的影响,阐明了编码器和解码器在微调过程中的作用。为指导自适应过程,我们提出了可靠的停止准则,同时考虑了直接方法和全局趋势分析。此外,我们证明 OCR 模型可被用于通过基于置信度选择信息性文本行来将标注成本削减一半,从而以更少的标注实现相同的性能。

关键词

引用

@article{arxiv.2503.19546,
  title  = {Practical Fine-Tuning of Autoregressive Models on Limited Handwritten Texts},
  author = {Jan Kohút and Michal Hradiš},
  journal= {arXiv preprint arXiv:2503.19546},
  year   = {2025}
}

备注

Submitted to ICDAR2025 conference