获取后适应:挤出文本到图像模型用于图像修复
计算机视觉与模式识别
2025-04-22 v1
摘要
最近,预训练的文本到图像(T2I)模型被广泛应用于实际图像修复,因为其强大的生成先验。然而,这些大型模型的控制通常需要大量高质量图像和巨大的计算资源进行训练,这既成本高昂又不利于隐私保护。本文发现,经过良好训练的大型 T2I 模型(如 Flux)能够生成与真实分布相匹配的多样化高质量图像,提供了 unlimited 的训练样本以缓解上述问题。具体而言,我们提出了用于图像修复的训练数据构建管道,称为 FluxGen,包括无条件图像生成、图像筛选和退化图像模拟。我们还精心设计了一个轻量级适配器(FluxIR),集成 squeeze-and-excitation 层,以控制基于大型扩散转换器(DiT)的 T2I 模型,以实现合理的细节修复。实验表明,我们提出的方法使 Flux 模型能够有效适应实际图像修复任务,在 synthetic 和真实退化数据集上实现卓越的评估指标和视觉质量——仅需约 8.5% 的训练成本即可达到当前方法的水平。
引用
@article{arxiv.2504.15159,
title = {Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration},
author = {Junyuan Deng and Xinyi Wu and Yongxing Yang and Congchao Zhu and Song Wang and Zhenyao Wu},
journal= {arXiv preprint arXiv:2504.15159},
year = {2025}
}
备注
Accepted by CVPR 2025