中文

真实场景中的场景文本图像超分辨率

计算机视觉与模式识别 2020-08-04 v3

摘要

低分辨率文本图像常见于自然场景,例如手机拍摄的文档。识别低分辨率文本图像具有挑战性,因为它们丢失了细节内容信息,导致识别准确率低。一种直观的解决方案是引入超分辨率(SR)技术作为预处理。然而,以往的单图像超分辨率(SISR)方法在合成低分辨率图像(如双三次下采样)上训练,过于简单且不适合真实的低分辨率文本识别。为此,我们提出一个真实场景文本 SR 数据集,称为 TextZoom。它包含在野外由不同焦距相机拍摄的成对真实低分辨率与高分辨率图像。如图 1 所示,它比合成数据更真实且更具挑战性。我们认为提升识别准确率是场景文本 SR 的最终目标。为此,我们提出了一种称为 TSRN 的新型文本超分辨率网络,包含三个新颖模块:(1)提出序列残差块以提取文本图像的序列信息;(2)设计边界感知损失以锐化字符边界;(3)提出中心对齐模块以缓解 TextZoom 中的错位问题。在 TextZoom 上的大量实验表明,与合成 SR 数据相比,我们的 TSRN 大幅提升了 CRNN 超过 13% 的识别准确率,以及 ASTER 和 MORAN 近 9.0% 的识别准确率。此外,我们的 TSRN 在提升 TextZoom 中低分辨率图像识别准确率方面明显优于 7 种最先进的 SR 方法。例如,其在 ASTER 和 CRNN 的识别准确率上分别超越 LapSRN 超过 5% 和 8%。我们的结果表明,野外低分辨率文本识别远未解决,因此需要更多的研究投入。

关键词

引用

@article{arxiv.2005.03341,
  title  = {Scene Text Image Super-Resolution in the Wild},
  author = {Wenjia Wang and Enze Xie and Xuebo Liu and Wenhai Wang and Ding Liang and Chunhua Shen and Xiang Bai},
  journal= {arXiv preprint arXiv:2005.03341},
  year   = {2020}
}

备注

Accepted by ECCV2020