UniDiff:稀疏注释下多模态遥感影像与土地覆盖分类的扩散模型参数高效适配
计算机视觉与模式识别
2025-12-02 v1
摘要
稀疏注释本质上限制了多模态遥感数据的应用:即便是最新的方法如 MSFMamba 在 labeled 数据方面仍受限于标注 availability,限制了其实际部署 despite 架构的进步。ImageNet 预训练模型提供了丰富的视觉表示,但将其适配到如高光谱成像 (HSI) 和合成孔径雷达 (SAR) 等异构模态而仅凭有限的 labeled 数据集仍具有挑战性。我们提出 UniDiff,一个参数高效框架,适配单个 ImageNet 预训练扩散模型以适应多个感知模态,仅凭目标域数据即可。UniDiff 结合 FiLM 基于时间的模态条件、约 5% 参数的高效适配,以及伪 RGB 锚定,以保持 pre-trained 表示并防止灾难性遗忘。该设计在稀疏注释条件下有效提取遥感数据的特征。我们使用两个 established 多模态基准数据集进行实验,结果表明,对 pre-trained 扩散模型的无监督适配有效缓解了注释约束,实现了多模态遥感数据的有效融合。
引用
@article{arxiv.2512.00261,
title = {UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations},
author = {Yuzhen Hu and Saurabh Prasad},
journal= {arXiv preprint arXiv:2512.00261},
year = {2025}
}
备注
Camera-ready for WACV 2026