Levenshtein OCR
计算机视觉与模式识别
2022-11-15 v2
摘要
提出了一种基于视觉-语言 Transformer(VLT)的新型场景文本识别器。受 NLP 领域 Levenshtein Transformer 的启发,所提方法(命名为 Levenshtein OCR,简称 LevOCR)探索了一种从裁剪的自然图像中自动转写文本内容的替代方式。具体而言,我们将场景文本识别问题视为一个迭代序列精炼过程。由纯视觉模型生成的初始预测序列被编码并输入跨模态 transformer 中与视觉特征交互和融合,以逐步逼近真实值。精炼过程通过两种基本的字符级操作完成:删除和插入,它们通过模仿学习习得,并允许并行解码、动态长度变化和良好的可解释性。定量实验清楚地表明 LevOCR 在标准基准上取得了最先进的性能,定性分析验证了所提 LevOCR 算法的有效性和优势。代码可在 https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/LevOCR 获取。
引用
@article{arxiv.2209.03594,
title = {Levenshtein OCR},
author = {Cheng Da and Peng Wang and Cong Yao},
journal= {arXiv preprint arXiv:2209.03594},
year = {2022}
}
备注
Accepted by ECCV2022