中文

Pixel Adapter:一种基于图的场景文本图像超分辨率后处理方法

计算机视觉与模式识别 2023-09-19 v1

摘要

当前的场景文本图像超分辨率方法主要关注提取鲁棒特征、获取文本信息以及复杂训练策略以生成超分辨率图像。然而,在将低分辨率图像转换为高分辨率图像过程中起关键作用的上采样模块,在现有工作中很少受到关注。为解决此问题,我们提出基于图注意力的像素适配模块(PAM)以应对由上采样引起的像素失真。PAM 通过让每个像素与其邻域交互并更新特征,有效捕获局部结构信息。与以往的图注意力机制不同,我们的方法通过消除对稀疏邻接矩阵的依赖并引入滑动窗口以实现高效并行计算,在效率与内存利用上实现了 2-3 个数量级的提升。此外,我们引入基于 MLP 的序列残差块(MSRB)以从文本图像中鲁棒提取特征,以及局部轮廓感知损失(Llca\mathcal{L}_{lca})以增强模型对细节的感知。在 TextZoom 上的综合实验表明,我们提出的方法生成了高质量超分辨率图像,在识别准确率上超越现有方法。对于单阶段与多阶段策略,我们分别取得了 0.7% 与 2.6% 的提升,将性能从 52.6% 与 53.7% 提高到 53.3% 与 56.3%。代码见 https://github.com/wenyu1009/RTSRN。

关键词

引用

@article{arxiv.2309.08919,
  title  = {Pixel Adapter: A Graph-Based Post-Processing Approach for Scene Text Image Super-Resolution},
  author = {Wenyu Zhang and Xin Deng and Baojun Jia and Xingtong Yu and Yifan Chen and jin Ma and Qing Ding and Xinming Zhang},
  journal= {arXiv preprint arXiv:2309.08919},
  year   = {2023}
}