中文

指令引导的场景文本识别

计算机视觉与模式识别 2025-01-03 v3

摘要

多模态模型在视觉识别任务中表现出引人注目的性能,因为自由形式的文本引导训练激发了理解细粒度视觉内容的能力。然而,由于自然图像与文本图像之间的构成差异,当前模型无法直接应用于场景文本识别(STR)。我们提出了一种新颖的指令引导场景文本识别(IGTR)范式,该范式将 STR 形式化为一个指令学习问题,并通过预测字符属性(例如字符频率、位置等)来理解文本图像。IGTR 首先设计出 条件,问题,答案\left \langle 条件, 问题, 答案 \right \rangle 指令三元组,提供丰富多样的字符属性描述。为了通过问答有效学习这些属性,IGTR 开发了一个轻量级指令编码器、一个跨模态特征融合模块和一个多任务答案头,从而引导精细的文本图像理解。此外,IGTR 仅通过使用不同的指令即可实现不同的识别流程,从而催生了一种基于字符理解的文本推理范式,这与当前方法有显著不同。在英文和中文基准上的实验表明,IGTR 以显著优势超越了现有模型,同时保持了较小的模型尺寸和快速的推理速度。此外,通过调整指令的采样,IGTR 提供了一种优雅的方式来处理罕见出现和形态相似字符的识别,这些曾是之前的挑战。代码:https://github.com/Topdu/OpenOCR。

关键词

引用

@article{arxiv.2401.17851,
  title  = {Instruction-Guided Scene Text Recognition},
  author = {Yongkun Du and Zhineng Chen and Yuchen Su and Caiyan Jia and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2401.17851},
  year   = {2025}
}

备注

Accepted by TPAMI