中文

TextBlockV2: 利用预训练语言模型实现免精确检测的场景文本识别

计算机视觉与模式识别 2024-03-18 v1

摘要

现有的场景文本识别器旨在从图像中定位和转录文本。然而,让一个识别器同时实现场景文本的精确检测和识别是具有挑战性的。受人类“一瞥-聚焦”识别流程以及预训练语言模型(PLM)在视觉任务上令人印象深刻的表现的启发,我们提出两个问题:1)“机器能否像人类一样在没有精确检测的情况下识别文本?”,如果可以,2)“除了单词或字符,文本块是否是场景文本识别的另一种选择?”为此,我们提出的场景文本识别器利用先进的PLM来增强性能,而无需细粒度检测。具体来说,我们首先使用一个简单的检测器进行块级文本检测,以获得粗略的位置信息。然后,我们使用大规模OCR数据集微调PLM以实现精确识别。得益于预训练阶段获得的全面语言知识,基于PLM的识别模块有效地处理了复杂场景,包括多行、反向、遮挡和不完全检测的文本。利用在场景识别基准上微调的语言模型和文本块检测范式,大量实验证明了我们的场景文本识别器在多个公共基准上的优越性能。此外,我们尝试直接从整个场景图像中识别文本,以展示PLM,甚至大型语言模型(LLM)的潜力。

关键词

引用

@article{arxiv.2403.10047,
  title  = {TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model},
  author = {Jiahao Lyu and Jin Wei and Gangyan Zeng and Zeng Li and Enze Xie and Wei Wang and Yu Zhou},
  journal= {arXiv preprint arXiv:2403.10047},
  year   = {2024}
}

备注

12 pages, 8 figures