中文

CharFormer:基于字形融合注意力机制的高精度字符图像去噪框架

计算机视觉与模式识别 2022-07-20 v2

摘要

退化图像普遍存在于字符图像的通用来源中,导致字符识别结果不理想。现有方法致力于复原退化字符图像。然而,这些方法所得去噪结果似乎并未提升字符识别性能。这主要是因为当前方法仅关注像素级信息而忽略字符的关键特征(如字形),导致去噪过程中字符字形受损。本文引入一种基于字形融合与注意力机制的新颖通用框架,即 CharFormer,用于精确复原字符图像而不改变其固有字形。与现有框架不同,CharFormer 引入一个并行目标任务以捕获额外信息并将其注入图像去噪主干,从而在字符图像去噪时保持字形一致性。此外,我们利用基于注意力的网络进行全局-局部特征交互,有助于处理盲去噪并增强去噪性能。我们在多个数据集上将 CharFormer 与最先进方法比较。实验结果表明 CharFormer 在定量与定性上的优越性。

关键词

引用

@article{arxiv.2207.07798,
  title  = {CharFormer: A Glyph Fusion based Attentive Framework for High-precision Character Image Denoising},
  author = {Daqian Shi and Xiaolei Diao and Lida Shi and Hao Tang and Yang Chi and Chuntao Li and Hao Xu},
  journal= {arXiv preprint arXiv:2207.07798},
  year   = {2022}
}

备注

Accepted by ACM MM 2022