基于文本提示扩散的图像超分辨率
计算机视觉与模式识别
2025-03-12 v5
摘要
图像超分辨率(SR)方法通常对退化进行建模,以提升在复杂未知退化场景中的重建精度。然而,从低分辨率图像中提取退化信息具有挑战性,这限制了模型性能。为提升图像SR性能,一种可行方法是引入额外先验。受多模态方法与文本提示图像处理进展的启发,我们将文本提示引入图像SR以提供退化先验。具体而言,我们首先设计了一个文本-图像生成流水线,通过文本退化表示与退化模型将文本集成到SR数据集中。采用离散化设计,文本表示灵活且用户友好。同时,我们提出PromptSR以实现文本提示SR。PromptSR利用最新的多模态大语言模型(MLLM)从低分辨率图像生成提示,并采用预训练语言模型(如T5或CLIP)增强文本理解。我们在文本-图像数据集上训练PromptSR。大量实验表明,将文本提示引入SR在合成与真实世界图像上均取得了令人印象深刻的結果。代码:https://github.com/zhengchen1999/PromptSR。
引用
@article{arxiv.2311.14282,
title = {Image Super-Resolution with Text Prompt Diffusion},
author = {Zheng Chen and Yulun Zhang and Jinjin Gu and Xin Yuan and Linghe Kong and Guihai Chen and Xiaokang Yang},
journal= {arXiv preprint arXiv:2311.14282},
year = {2025}
}
备注
Code is available at https://github.com/zhengchen1999/PromptSR