CharFormer:基于字形融合注意力机制的高精度字符图像去噪框架
计算机视觉与模式识别
2022-07-20 v2
摘要
退化图像普遍存在于字符图像的通用来源中,导致字符识别结果不理想。现有方法致力于复原退化字符图像。然而,这些方法所得去噪结果似乎并未提升字符识别性能。这主要是因为当前方法仅关注像素级信息而忽略字符的关键特征(如字形),导致去噪过程中字符字形受损。本文引入一种基于字形融合与注意力机制的新颖通用框架,即 CharFormer,用于精确复原字符图像而不改变其固有字形。与现有框架不同,CharFormer 引入一个并行目标任务以捕获额外信息并将其注入图像去噪主干,从而在字符图像去噪时保持字形一致性。此外,我们利用基于注意力的网络进行全局-局部特征交互,有助于处理盲去噪并增强去噪性能。我们在多个数据集上将 CharFormer 与最先进方法比较。实验结果表明 CharFormer 在定量与定性上的优越性。
引用
@article{arxiv.2207.07798,
title = {CharFormer: A Glyph Fusion based Attentive Framework for High-precision Character Image Denoising},
author = {Daqian Shi and Xiaolei Diao and Lida Shi and Hao Tang and Yang Chi and Chuntao Li and Hao Xu},
journal= {arXiv preprint arXiv:2207.07798},
year = {2022}
}
备注
Accepted by ACM MM 2022