预训练潜在扩散模型微调技术的定量比较:用于未见SAR图像生成
计算机视觉与模式识别
2025-08-15 v2 人工智能
摘要
我们提出了一种框架,用于将大型预训练潜在扩散模型适配至高分辨率合成孔径雷达(SAR)图像生成。该方法支持可控合成以及训练集之外罕见或分布外场景的创建。我们并非从头训练特定任务的小型模型,而是将一个开源文本到图像基础模型适配至SAR模态,利用其语义先验将提示词与SAR成像物理(侧视几何、斜距投影以及具有重尾统计特性的相干散斑)对齐。使用一个包含10万张SAR图像的数据集,我们在UNet扩散骨干网络、变分自编码器(VAE)和文本编码器上比较了全参数微调与参数高效的秩自适应(LoRA)。评估结合了:(i) 与真实SAR幅度分布的统计距离,(ii) 通过灰度共生矩阵(GLCM)描述符进行的纹理相似性,以及(iii) 使用SAR专用CLIP模型进行的语义对齐。结果表明,混合策略——全UNet微调配合文本编码器的LoRA及可学习token嵌入——最能保持SAR几何与纹理,同时维持提示词保真度。该框架支持基于文本的控制和多模态条件输入(如分割图、TerraSAR-X或光学引导),为地球观测中的大规模SAR场景数据增强和未见场景模拟开辟了新路径。
引用
@article{arxiv.2506.13307,
title = {Quantitative Comparison of Fine-Tuning Techniques for Pretrained Latent Diffusion Models in the Generation of Unseen SAR Images},
author = {Solène Debuysère and Nicolas Trouvé and Nathan Letheule and Olivier Lévêque and Elise Colin},
journal= {arXiv preprint arXiv:2506.13307},
year = {2025}
}