中文

Levenshtein OCR

计算机视觉与模式识别 2022-11-15 v2

摘要

提出了一种基于视觉-语言 Transformer(VLT)的新型场景文本识别器。受 NLP 领域 Levenshtein Transformer 的启发,所提方法(命名为 Levenshtein OCR,简称 LevOCR)探索了一种从裁剪的自然图像中自动转写文本内容的替代方式。具体而言,我们将场景文本识别问题视为一个迭代序列精炼过程。由纯视觉模型生成的初始预测序列被编码并输入跨模态 transformer 中与视觉特征交互和融合,以逐步逼近真实值。精炼过程通过两种基本的字符级操作完成:删除和插入,它们通过模仿学习习得,并允许并行解码、动态长度变化和良好的可解释性。定量实验清楚地表明 LevOCR 在标准基准上取得了最先进的性能,定性分析验证了所提 LevOCR 算法的有效性和优势。代码可在 https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/LevOCR 获取。

关键词

引用

@article{arxiv.2209.03594,
  title  = {Levenshtein OCR},
  author = {Cheng Da and Peng Wang and Cong Yao},
  journal= {arXiv preprint arXiv:2209.03594},
  year   = {2022}
}

备注

Accepted by ECCV2022