基于文本条件扩散模型的场景文本图像超分辨率
计算机视觉与模式识别
2023-12-25 v2
摘要
场景文本图像超分辨率(STISR)作为场景文本识别的预处理方法近来取得巨大成功。STISR 旨在将真实场景中模糊含噪的低分辨率(LR)文本图像转换为适于场景文本识别的清晰高分辨率(HR)文本图像。本研究利用以惊人文本到图像合成能力著称的文本条件扩散模型(DMs)来完成 STISR 任务。实验结果表明,文本条件 DMs 明显超越现有 STISR 方法。尤其在将 LR 文本图像中的文本作为输入时,文本条件 DMs 能够生成更优质量的超分辨率文本图像。利用该能力,我们提出一种用于合成 LR-HR 配对文本图像数据集的新框架。该框架由三个专用文本条件 DMs 组成,分别致力于文本图像合成、超分辨率与图像退化。这三个模块对于合成不同的 LR 与 HR 配对图像至关重要,其更适于训练 STISR 方法。我们的实验证实,这些合成图像对在 TextZoom 评测中显著提升了 STISR 方法的性能。
引用
@article{arxiv.2311.09759,
title = {Scene Text Image Super-resolution based on Text-conditional Diffusion Models},
author = {Chihiro Noguchi and Shun Fukuda and Masao Yamanaka},
journal= {arXiv preprint arXiv:2311.09759},
year = {2023}
}
备注
WACV 2024