先恢复文本,再增强图像:基于字形结构引导的双阶段场景文本图像超分辨率
计算机视觉与模式识别
2025-11-25 v2
摘要
当前图像超分辨方法在自然图像上表现优异,但会扭曲文本,导致图像质量与文本可读性之间存在根本性权衡。为此,我们引入 TIGER(Text-Image Guided supEr-Resolution),一个新型双阶段框架,通过“文本优先,图像后置”范式打破这一权衡。TIGER 显式地将字形恢复与图像增强解耦:首先重建精确的文本结构,并用其指导整个图像的超分辨率,从而确保高保真度和可读性。为支持全面的训练和评估,我们提出 UZ-ST(UltraZoom-Scene Text)数据集,这是第一个包含极端缩放的中文场景文本数据集。大量实验表明,TIGER 实现了最先进的性能,提升了文本可读性和图像质量。
引用
@article{arxiv.2510.21590,
title = {Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance},
author = {Minxing Luo and Linlong Fan and Wang Qiushi and Ge Wu and Yiyan Luo and Yuhang Yu and Jinwei Chen and Yaxing Wang and Qingnan Fan and Jian Yang},
journal= {arXiv preprint arXiv:2510.21590},
year = {2025}
}