中文

DOTA:面向端到端文本识别的可变形优化 Transformer 架构与检索增强生成

计算机视觉与模式识别 2025-05-08 v1 人工智能

摘要

自然图像中的文本识别仍然是一项具有挑战性但又至关重要的任务,其广泛应用横跨计算机视觉和自然语言处理。本文介绍了一种新颖的端到端框架,该框架将 ResNet 和 Vision Transformer 骨干网络与先进方法相结合,包括可变形卷积、检索增强生成和条件随机场(CRF)。这些创新共同增强了特征表示,并提高了光学字符识别(OCR)的性能。具体来说,该框架将第三和第四块中的标准卷积层替换为可变形卷积,利用自适应 dropout 进行正则化,并引入 CRF 以实现更精细的序列建模。在六个基准数据集 IC13、IC15、SVT、IIIT5K、SVTP 和 CUTE80 上进行的大量实验验证了所提方法的有效性,取得了显著的准确率:IC13 上为 97.32%,IC15 上为 58.26%,SVT 上为 88.10%,IIIT5K 上为 74.13%,SVTP 上为 82.17%,CUTE80 上为 66.67%,平均准确率达到 77.77%。这些结果确立了文本识别的新 state-of-the-art,证明了该方法在多样且具有挑战性的数据集上的鲁棒性。

关键词

引用

@article{arxiv.2505.04175,
  title  = {DOTA: Deformable Optimized Transformer Architecture for End-to-End Text Recognition with Retrieval-Augmented Generation},
  author = {Naphat Nithisopa and Teerapong Panboonyuen},
  journal= {arXiv preprint arXiv:2505.04175},
  year   = {2025}
}