中文

NCAP:基于非分类先验的场景文本图像超分辨率

计算机视觉与模式识别 2025-04-02 v1

摘要

场景文本图像超分辨率(STISR)增强低分辨率图像的分辨率和质量。不同于以往将场景文本图像视为自然图像的研究,近期采用文本先验(TP)的方法(从预训练文本识别器中提取)显示出卓越的性能。然而,两个主要问题仍待解决:(1)显式的分类先验如 TP 在错误情况下可能负面影响 STISR。我们揭示了这些显式先验不稳定,并提出用 penultimate 层表示替换它们的 Non-CAtegorical Prior(NCAP)。(2)用于生成 TP 的预训练识别器在低分辨率图像上表现不佳。为此,大多数研究在训练时联合训练识别器与 STISR 网络,以弥合低分辨率和高分辨率图像之间的领域差距,但会导致该先验模态出现过度自信现象。我们指出了这一问题,并提出通过混合硬标签和软标签来缓解其影响。在 TextZoom 数据集上的实验表明,我们的方法性能提升 3.5%,且在四个文本识别数据集上 generalization 性能提升 14.8%。该方法可推广至所有 TP 指导的 STISR 网络。

关键词

引用

@article{arxiv.2504.00410,
  title  = {NCAP: Scene Text Image Super-Resolution with Non-CAtegorical Prior},
  author = {Dongwoo Park and Suk Pil Ko},
  journal= {arXiv preprint arXiv:2504.00410},
  year   = {2025}
}

备注

WACV 2025