中文

一个模型处理两项任务:通过迭代相互指导协同识别与恢复低分辨率场景文本图像

计算机视觉与模式识别 2024-09-24 v1

摘要

从高分辨率(HR)图像中进行场景文本识别(STR)已取得显著成功,然而由于视觉信息不足,低分辨率(LR)图像上的文本读取仍具挑战性。因此,最近提出了许多场景文本图像超分辨率(STISR)模型来为 LR 图像生成超分辨率(SR)图像,随后在 SR 图像上进行 STR,从而提升识别性能。然而,这些方法存在两个主要弱点。一方面,STISR 方法可能生成不完美甚至错误的 SR 图像,从而误导后续 STR 模型的识别。另一方面,由于 STISR 和 STR 模型被联合优化,为追求高识别精度,SR 图像的保真度可能受损。因此,识别性能和 STISR 模型的保真度均不尽如人意。那么,我们能否同时实现高识别性能和良好的保真度?为此,本文提出一种名为 IMAGE(Iterative MutuAl GuidancE 的缩写)的新方法,以同时有效地识别和恢复 LR 场景文本图像。具体而言,IMAGE 包含一个用于识别的专用 STR 模型和一个用于恢复 LR 图像的定制 STISR 模型,二者分别进行优化。我们开发了一种迭代相互指导机制,STR 模型提供高级语义信息作为线索给 STISR 模型以实现更好的超分辨率,同时 STISR 模型向 STR 模型提供必要的低级像素线索以实现更准确的识别。在两个 LR 数据集上的大量实验表明,我们的方法在识别性能和超分辨率保真度方面均优于现有工作。

关键词

引用

@article{arxiv.2409.14483,
  title  = {One Model for Two Tasks: Cooperatively Recognizing and Recovering Low-Resolution Scene Text Images by Iterative Mutual Guidance},
  author = {Minyi Zhao and Yang Wang and Jihong Guan and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:2409.14483},
  year   = {2024}
}