中文

基于置换自回归序列模型的场景文本识别

计算机视觉与模式识别 2022-07-15 v1 计算与语言

摘要

上下文感知的场景文本识别(STR)方法通常使用内部自回归(AR)语言模型(LM)。AR 模型的固有局限催生了采用外部 LM 的两阶段方法。外部 LM 对输入图像的条件独立性可能使其错误地纠正正确预测,导致显著低效。我们的方法 PARSeq 利用置换语言建模学习一组共享权重的内部 AR LM。它统一了无上下文非 AR 与上下文感知 AR 推理,以及利用双向上下文的迭代精炼。仅使用合成训练数据,PARSeq 在 STR 基准(准确率 91.9%)及更具挑战性的数据集上达到最先进(SOTA)结果。当使用真实数据训练时,它确立了新的 SOTA 结果(准确率 96.0%)。由于其简单、统一的结构与并行词元处理,PARSeq 在准确率对参数数量、FLOPS 和延迟的权衡上是最优的。由于其广泛使用注意力机制,它对真实世界图像中常见的任意方向文本具有鲁棒性。代码、预训练权重和数据可见于:https://github.com/baudm/parseq。

关键词

引用

@article{arxiv.2207.06966,
  title  = {Scene Text Recognition with Permuted Autoregressive Sequence Models},
  author = {Darwin Bautista and Rowel Atienza},
  journal= {arXiv preprint arXiv:2207.06966},
  year   = {2022}
}

备注

Accepted at the 17th European Conference on Computer Vision (ECCV 2022)