面向盲文本图像超分辨率的学习生成式结构先验
计算机视觉与模式识别
2023-03-28 v1
摘要
盲文本图像超分辨率(SR)具有挑战性,因为需要处理多样的字体风格与未知的退化。为解决该问题,现有方法并行执行字符识别以正则化 SR 任务,或通过损失约束,或通过中间特征条件。然而,在面对严重退化时,此类高层先验仍可能失效。考虑到具有复杂结构的字符(例如将多个象形或表意符号组合为单字的汉字),问题进一步加剧。在本工作中,我们提出了一种更关注字符结构的新型先验。具体而言,我们学习在 StyleGAN 中封装丰富且多样的结构,并利用此类生成式结构先验进行复原。为限制 StyleGAN 的生成空间使其遵循字符结构同时在处理不同字体风格时保持灵活,我们将每个字符的离散特征存于码本中。该码本随后驱动 StyleGAN 生成高分辨率结构细节以辅助文本 SR。相较于基于字符识别的先验,所提结构先验施加了更强的字符特异性引导,以恢复指定字符忠实而精确的笔画。在合成与真实数据集上的大量实验证明了所提生成式结构先验在促进鲁棒文本 SR 方面的优异性能。
引用
@article{arxiv.2303.14726,
title = {Learning Generative Structure Prior for Blind Text Image Super-resolution},
author = {Xiaoming Li and Wangmeng Zuo and Chen Change Loy},
journal= {arXiv preprint arXiv:2303.14726},
year = {2023}
}
备注
CVPR 2023. Code: https://github.com/csxmli2016/MARCONet