中文

CLIPPan:将 CLIP 适配作为无监督图像拼接的监督器

图像与视频处理 2025-11-17 v1 人工智能 计算机视觉与模式识别

摘要

尽管监督式图像拼接神经网络取得了显著进展,但这些方法因训练数据与实际场景之间的分辨率差异,面临域适应挑战。为弥合这一差距,我们提出一种无监督图像拼接框架 CLIPPan,直接在全分辨率下进行模型训练,借助 CLIP(一种视觉语言模型)作为监督器。然而,直接将 CLIP 应用于图像拼接监督仍面临挑战,主要因其对自然图像倾向性强且对拼接任务理解有限。因此,我们首先引入轻量级微调管线,使 CLIP 能够识别低分辨率多光谱、黑白和高分辨率多光谱图像,并理解拼接过程。随后,在经过适配的 CLIP 基础上,我们构建一种新型损失函数,集成语义语言约束,将图像级融合过渡与协议对齐的文本提示(如 Wald 或 Khan 的描述)对齐,从而使 CLIPPan 能借助语言作为强大的监督信号,在无 ground truth 的情况下指导融合学习。大量实验表明,CLIPPan 在各种拼接主干网络上均在真实数据集上实现了谱域和空域保真性的提升,为无监督全分辨率图像拼接树立了新标杆。

关键词

引用

@article{arxiv.2511.10896,
  title  = {CLIPPan: Adapting CLIP as A Supervisor for Unsupervised Pansharpening},
  author = {Lihua Jian and Jiabo Liu and Shaowu Wu and Lihui Chen},
  journal= {arXiv preprint arXiv:2511.10896},
  year   = {2025}
}

备注

Accepted to AAAI 2026