TextDiff:用于场景文本图像超分辨率的掩码引导残差扩散模型
计算机视觉与模式识别
2025-03-18 v2
摘要
场景文本图像超分辨率的目标是从无法辨识的低分辨率输入重建高分辨率文本行图像。现有依赖像素级损失优化的方法往往产生明显模糊的文本边缘,严重影响文本的可读性与可辨识性。为解决这些问题,我们提出 TextDiff,首个专为场景文本图像超分辨率设计的基于扩散的框架。其包含两个模块:文本增强模块(TEM)与掩码引导残差扩散模块(MRD)。TEM 生成初始去模糊文本图像及编码文本空间位置的掩码。MRD 通过对真实图像与初始去模糊图像间残差建模,有效锐化文本边缘。大量实验表明,我们的 TextDiff 在公开基准数据集上取得最先进(SOTA)性能,并能提升场景文本图像可读性。此外,我们所提 MRD 模块即插即用,可有效锐化 SOTA 方法生成的文本边缘,该增强不仅改善 SOTA 方法结果的可读性与可辨识性,且无需任何额外联合训练。代码见:https://github.com/Lenubolim/TextDiff。
引用
@article{arxiv.2308.06743,
title = {TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution},
author = {Baolin Liu and Zongyuan Yang and Pengfei Wang and Junjie Zhou and Ziqi Liu and Ziyi Song and Yan Liu and Yongping Xiong},
journal= {arXiv preprint arXiv:2308.06743},
year = {2025}
}
备注
Correct and update some data