中文

Text Gestalt:笔画感知的场景文本图像超分辨率

计算机视觉与模式识别 2021-12-16 v1 人工智能

摘要

在过去十年中,深度学习的兴起见证了场景文本识别的快速发展。然而,低分辨率场景文本图像的识别仍具挑战。尽管已有一些超分辨率方法提出以应对该问题,它们通常将文本图像视为通用图像,却忽视了笔画(文本的原子单元)的视觉质量对文本识别起关键作用这一事实。根据格式塔心理学,人类能够在先验知识引导下将部分细节组合为最相似的对象。类似地,当人类观察低分辨率文本图像时,会固有地利用部分笔画级细节来恢复整体字符的外观。受格式塔心理学启发,我们提出一种笔画感知的场景文本图像超分辨率方法,包含笔画聚焦模块(SFM)以关注文本图像中字符的笔画级内部结构。具体而言,我们尝试设计规则在笔画级分解英文字符与数字,然后预训练文本识别器以提供笔画级注意力图作为位置线索,从而控制生成的超分辨率图像与高分辨率真值间的一致性。广泛的实验结果验证了所提方法确实能在 TextZoom 与人工构建的中文字符数据集 Degraded-IC13 上生成更具可辨性的图像。此外,由于所提 SFM 仅用于在训练时提供笔画级引导,其在测试阶段不会带来任何时间开销。代码见 https://github.com/FudanVI/FudanOCR/tree/main/text-gestalt。

关键词

引用

@article{arxiv.2112.08171,
  title  = {Text Gestalt: Stroke-Aware Scene Text Image Super-Resolution},
  author = {Jingye Chen and Haiyang Yu and Jianqi Ma and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2112.08171},
  year   = {2021}
}

备注

Accepted to AAAI2022. Code is available at https://github.com/FudanVI/FudanOCR/tree/main/text-gestalt