用于中文文本图像超分辨率的增强生成式结构先验
计算机视觉与模式识别
2025-08-12 v1
摘要
忠实的文本图像超分辨率(SR)具有挑战性,因为每个字符都有独特的结构,并且通常表现出多样的字体风格和布局。虽然现有方法主要关注英文文本,但对像中文这样更复杂的文字关注较少。在本文中,我们引入了一个高质量的文本图像超分辨率框架,旨在恢复低分辨率(LR)中文字符的精确笔画。与依赖字符识别先验来正则化超分辨率任务的方法不同,我们提出了一种新颖的结构先验,它提供结构级别的指导以增强视觉质量。我们的框架将这种结构先验整合到一个StyleGAN模型中,利用其生成能力进行恢复。为了在适应各种字体风格和布局的同时保持字符结构的完整性,我们实现了一个基于码本的机制来限制StyleGAN的生成空间。码本中的每个码代表一个特定字符的结构,而StyleGAN中的向量 控制字符的风格,包括字体、方向和位置。通过码本与风格之间的协同交互,我们生成了一个在空间和结构上都与低分辨率字符对齐的高分辨率结构先验。实验表明,这种结构先验提供了鲁棒的、字符特定的指导,能够准确恢复退化字符的清晰笔画,即使对于具有不规则布局的真实世界低分辨率中文文本也是如此。我们的代码和预训练模型将在 https://github.com/csxmli2016/MARCONetPlusPlus 上发布。
引用
@article{arxiv.2508.07537,
title = {Enhanced Generative Structure Prior for Chinese Text Image Super-resolution},
author = {Xiaoming Li and Wangmeng Zuo and Chen Change Loy},
journal= {arXiv preprint arXiv:2508.07537},
year = {2025}
}
备注
TPAMI