GramSR:面向基于扩散的超分辨率的视觉特征条件化
计算机视觉与模式识别
2026-04-29 v1
摘要
尽管近期取得了进展,单图像超分辨率(SR)仍然具有挑战性,特别是在具有复杂退化的真实世界场景中。基于扩散的SR方法,特别是那些构建于Stable Diffusion之上的方法,利用了强大的生成先验,但通常依赖于源自语义描述的文本条件化。这种文本描述仅提供高级语义,缺乏忠实恢复所需的空间对齐视觉信息,导致抽象语义与空间对齐视觉细节之间存在表示鸿沟。为了解决这一局限性,我们提出了GramSR,这是一个单步基于扩散的SR框架,它使用预训练的DINOv3编码器从低分辨率输入中提取的密集视觉特征来替代文本条件化。GramSR采用三阶段LoRA架构,其中像素级、语义级和纹理级LoRA模块依次进行训练。像素级模块侧重于使用 损失去除退化,语义级模块通过LPIPS和CSD损失增强感知细节,纹理级模块通过从DINOv3特征计算的Gram矩阵损失来强制执行特征相关性一致性。在推理时,独立的引导尺度能够对退化去除、语义增强和纹理保持进行灵活控制。在标准SR基准上的大量实验表明,GramSR始终优于现有的单步基于扩散的方法,实现了卓越的结构保真度和纹理真实感。本工作的代码可在:https://github.com/aimagelab/GramSR 获取。
引用
@article{arxiv.2604.25457,
title = {GramSR: Visual Feature Conditioning for Diffusion-Based Super-Resolution},
author = {Fabio D'Oronzio and Federico Putamorsi and Leonardo Zini and Marcella Cornia and Lorenzo Baraldi},
journal= {arXiv preprint arXiv:2604.25457},
year = {2026}
}
备注
Accepted at the 28th International Conference on Pattern Recognition