中文

基于内容感知损失与十字交叉 Transformer 模块的场景文本图像超分辨率

计算机视觉与模式识别 2022-10-14 v1

摘要

文本图像超分辨率是一项独特且重要的任务,用于增强人类可读的文本图像。它被广泛用作场景文本识别的预处理。然而,由于自然场景中的复杂退化,从低分辨率输入恢复高分辨率文本模糊且具挑战性。现有方法主要利用为自然图像重建设计的逐像素损失训练的深度神经网络,忽略了文本独有的字符特性。少数工作提出了基于内容的损失。但它们仅关注文本识别器的精度,而重建图像对人类而言可能仍模糊。此外,它们常弱泛化于跨语言处理。为此,我们提出 TATSR,一种文本感知文本超分辨率框架,其利用十字交叉 Transformer 模块(CCTB)与一种新颖的内容感知(CP)损失有效学习独特的文本特性。CCTB 通过两个正交 Transformer 分别提取文本图像的垂直与水平内容信息。CP 损失借助多尺度文本识别特征以内容语义监督文本重建,将内容感知有效融入框架。在多种语言数据集上的大量实验表明,TATSR 在识别精度与人类感知上均优于最先进(SOTA)方法。

关键词

引用

@article{arxiv.2210.06924,
  title  = {Scene Text Image Super-Resolution via Content Perceptual Loss and Criss-Cross Transformer Blocks},
  author = {Rui Qin and Bin Wang and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2210.06924},
  year   = {2022}
}