MSCloudCAM:用于多光谱云分割的卷积跨注意力多尺度上下文适配
计算机视觉与模式识别
2026-01-28 v4 人工智能
机器学习
摘要
云层仍是光学卫星成像中的主要障碍,限制了准确的环境和气候分析。为解决云类型在强光谱波动和大尺度差异方面的挑战,我们提出MSCloudCAM,一种针对多光谱和多传感器云分割的新型多尺度上下文适配器网络,采用卷积基于跨注意力的设计。MSCloudCAM的一个关键贡献是显式建模多个互补的多尺度上下文提取器。此外,我们所提出的模型不仅简单堆叠或拼接其输出,而是使用一个提取器的细节分辨率特征和另一个提取器的全局上下文表示,实现动态、尺度感知的特征选择。基于这一思想,我们设计了一种新的基于卷积的跨注意力适配器,有效融合局部细节信息与更广泛的多尺度上下文。集成层次化视觉主干并通过通道和空间注意力机制加以细化,MSCloudCAM实现了强大的光谱-空间判别能力。在各种多传感器数据集上进行的实验,例如CloudSEN12(Sentinel-2)和L8Biome(Landsat-8),表明MSCloudCAM在整体分割性能和竞争的类别准确率方面优于最新的SOTA模型,同时保持竞争的模型复杂度,凸显了该设计在大规模地球观察中的新颖性和有效性。
关键词
引用
@article{arxiv.2510.10802,
title = {MSCloudCAM: Multi-Scale Context Adaptation with Convolutional Cross-Attention for Multispectral Cloud Segmentation},
author = {Md Abdullah Al Mazid and Liangdong Deng and Naphtali Rishe},
journal= {arXiv preprint arXiv:2510.10802},
year = {2026}
}
备注
6 pages, 3 Figures