像素级和语义级可调超分辨:Dual-LoRA方法
计算机视觉与模式识别
2025-04-04 v2
摘要
扩散先验基于的方法在现实世界图像超分辨(SR)方面取得了令人瞩目的成果。然而,大多数现有方法在训练过程中将像素级和语义级SR目标交织在一起,难以平衡像素级保真度和感知质量。同时,用户对SR结果有不同的偏好,因此需要开发一种可在推理过程中根据不同保真-感知偏好进行调整的可调SR模型,而无需重新训练。我们提出了像素级和语义级可调超分辨(PiSA-SR),该方法在预训练的stable-diffusion(SD)模型上学习两个LoRA模块,以实现更好的可调SR结果。我们首先将基于SD的SR问题表述为学习低质量输入与高质量输出之间的残差,然后表明学习目标可以解耦为两个不同的LoRA权重空间:一个以损失用于像素级回归,另一个以LPIPS和分类器分数蒸馏损失从预训练的分类和SD模型中提取语义信息。在默认设置下,PiSA-SR只需一次扩散步骤即可实现质量和效率双优的领先现实SR结果。通过在两个LoRA模块上引入两个可调guidance比例,以控制推理过程中像素保真度和语义细节强度,PiSA-SR可根据用户偏好提供灵活的SR结果,而无需重新训练。代码和模型可在https://github.com/csslc/PiSA-SR找到。
引用
@article{arxiv.2412.03017,
title = {Pixel-level and Semantic-level Adjustable Super-resolution: A Dual-LoRA Approach},
author = {Lingchen Sun and Rongyuan Wu and Zhiyuan Ma and Shuaizheng Liu and Qiaosi Yi and Lei Zhang},
journal= {arXiv preprint arXiv:2412.03017},
year = {2025}
}