物理引导的视觉语言模型先验用于全场景云 removal
计算机视觉与模式识别
2026-03-10 v1
摘要
云 removal 是光学遥感中 fundamental 的挑战,由于异构降解而具备复杂性。薄云通过部分透射扭曲辐射计量,而厚云则遮蔽表面。现有流程将薄云校正与厚云重建分离,需显式云类型决策,常导致混合云场景中误差累积和边界不连续。因此,我们提出一种名为物理-视觉语言模型全场景云 removal(PhyVLM-CR)的新方法,将视觉语言模型(VLM)的语义能力整合到物理恢复模型中,实现高保真统一云 removal。具体而言,来自 VLM(如 Qwen)的认知先验被转化为物理散射参数和幻觉置信度图。利用该置信度图作为连续软门,本方法通过自适应加权实现统一恢复:在高透射区域优先进行物理反演以保持辐射计量忠实度,在低置信度遮蔽区域平滑过渡至时序参考重建。该机制消除对显式边界描绘的需求,确保异构云覆盖区域的连贯移除。在真实世界的 Sentinel-2 表面反射率影像实验中,验证本方法在云 removal 与内容保持之间实现了显著平衡,生成无幻觉且定量精度显著优于现有方法的无云化结果。
引用
@article{arxiv.2603.07074,
title = {Physics-Guided VLM Priors for All-Cloud Removal},
author = {Liying Xu and Huifang Li and Huanfeng Shen},
journal= {arXiv preprint arXiv:2603.07074},
year = {2026}
}