中文

面向空间形变鲁棒场景文本图像超分辨率的文本注意力网络

计算机视觉与模式识别 2022-03-21 v2

摘要

场景文本图像超分辨率旨在提升低分辨率图像中文本的分辨率与可读性。尽管深度卷积神经网络(CNN)已取得显著进展,对于空间形变文本(尤其是旋转与曲线形文本)仍难以重建高分辨率图像。这是因为当前基于 CNN 的方法采用基于局部性的操作,无法有效应对形变引起的变化。在本文中,我们提出一种基于 CNN 的文本注意力网络(TATT)来解决该问题。文本语义首先由文本识别模块提取作为文本先验信息。随后我们设计了一种新颖的基于 transformer 的模块,利用全局注意力机制,将文本先验的语义引导作用于文本重建过程。此外,我们提出文本结构一致性损失,通过对规整与形变文本重建结果施加结构一致性来优化视觉外观。在基准 TextZoom 数据集上的实验表明,所提 TATT 不仅在 PSNR/SSIM 指标上达到最先进性能,还显著提升了下游文本识别任务的识别准确率,尤其针对多方向与弯曲形状的文本实例。代码见 https://github.com/mjq11302010044/TATT。

关键词

引用

@article{arxiv.2203.09388,
  title  = {A Text Attention Network for Spatial Deformation Robust Scene Text Image Super-resolution},
  author = {Jianqi Ma and Zhetong Liang and Lei Zhang},
  journal= {arXiv preprint arXiv:2203.09388},
  year   = {2022}
}

备注

Accepted to CVPR2022