F2IDiff:使用特征到图像扩散基础模型实现真实世界图像超分辨率
计算机视觉与模式识别
2026-01-01 v1 人工智能
图像与视频处理
摘要
随着生成式人工智能的出现,单图像超分辨率(SISR)质量得到了显著提升,因为文本到图像扩散(T2IDiff)基础模型(FM)学习到的强先验可以弥合高分辨率(HR)和低分辨率(LR)图像之间的差距。然而,旗舰智能手机相机在采用生成模型方面进展缓慢,因为强生成可能导致不希望的幻觉。对于学术界常见的严重降质LR图像,需要强生成,并且由于LR和HR图像之间的巨大差距,幻觉更容易被容忍。相比之下,在消费摄影中,LR图像具有更高的保真度,只需要最少的无幻觉生成。我们假设SISR中的生成由FM条件特征的严格性和丰富性控制。首先,文本特征是高级特征,通常无法描述图像中的细微纹理。此外,智能手机LR图像至少为,而基于T2IDiff FM构建的SISR网络被设计用于在更小的图像()上进行推理。因此,SISR推理必须在小的图像块上进行,而这些图像块通常无法被文本特征准确描述。为了解决这些缺点,我们引入了一个基于具有低级特征条件的FM构建的SISR网络,具体来说是DINOv2特征,我们称之为特征到图像扩散(F2IDiff)基础模型(FM)。低级特征提供了更严格的条件,同时即使是小图像块也能提供丰富的描述。
引用
@article{arxiv.2512.24473,
title = {F2IDiff: Real-world Image Super-resolution using Feature to Image Diffusion Foundation Model},
author = {Devendra K. Jangid and Ripon K. Saha and Dilshan Godaliyadda and Jing Li and Seok-Jun Lee and Hamid R. Sheikh},
journal= {arXiv preprint arXiv:2512.24473},
year = {2026}
}