中文

IPAD:用于场景文本识别的迭代、并行与基于扩散的网络

计算机视觉与模式识别 2025-04-01 v3

摘要

如今,由于场景文本识别的广泛应用,它吸引了越来越多的关注。大多数最先进的方法采用带有注意力机制的编码器-解码器框架,自回归地从左到右生成文本。尽管性能令人信服,但这种顺序解码策略限制了推理速度。相反,非自回归模型提供了更快、同时的预测,但通常会牺牲准确性。虽然利用显式语言模型可以提高性能,但这会增加计算负担。此外,将语言知识与视觉信息分离可能会损害最终的预测。在本文中,我们提出了一种替代解决方案,使用采用由易到难解码策略的并行和迭代解码器。此外,我们将文本识别视为基于图像的条件文本生成任务,并利用离散扩散策略,确保对双向上下文信息进行详尽的探索。大量实验表明,所提出的方法在基准数据集上取得了优异的结果,包括中文和英文文本图像。

关键词

引用

@article{arxiv.2312.11923,
  title  = {IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition},
  author = {Xiaomeng Yang and Zhi Qiao and Yu Zhou},
  journal= {arXiv preprint arXiv:2312.11923},
  year   = {2025}
}

备注

Accepted by IJCV