中文

CLAIRE:基于 RIFT 损失和 Phi-3 小型语言模型的双编码器网络,用于跨模态合成孔径雷达和光学遥感地覆盖分割

计算机视觉与模式识别 2025-09-16 v1

摘要

准确地从卫星影像中进行土地覆盖分类对于环境监测和可持续资源管理至关重要。然而,由于自然景观的复杂性、类别之间的视觉相似性以及数据集中显著的类别不平衡,这仍然具有挑战性。为了解决这些问题,我们提出了一种双编码器架构,独立地从光学和合成孔径雷达 (SAR) 影像中提取模态特定特征,然后通过名为 Cross-modality Land cover segmentation with Attention and Imbalance-aware Reasoning-Enhanced Explanations (CLAIRE) 的跨模态注意力融合模块进行融合。这种融合机制突出了互补的空间和纹理特征,使网络能够更好地捕获细致且多样化的土地覆盖模式。我们采用包含加权焦点损失和 Tversky 损失的混合损失函数,称为 RIFT (稀有实例焦点-Tversky),以解决类别不平衡问题并提高跨越欠代表类别的分割性能。我们的模型在多个基准数据集上取得了具竞争力的性能:在 WHU-OPT-SAR 数据集上实现 56.02% 的平均交并比 (mIoU) 和 84.56% 的整体准确率 (OA);在 OpenEarthMap-SAR 数据集上表现出强大的泛化能力,mIoU 为 59.89%,OA 为 73.92%;在 PIE-RGB-SAR 数据集上表现出惊人的对云层遮蔽条件下的鲁棒性,mIoU 为 86.86%,OA 为 94.58%。此外,我们引入了一个由小型语言模型 (Phi-3) 生成的基于指标的推理模块,该模块为模型预测生成专家级别、样本特定的解释,从而增强了透明度和可解释性。

关键词

引用

@article{arxiv.2509.11952,
  title  = {CLAIRE: A Dual Encoder Network with RIFT Loss and Phi-3 Small Language Model Based Interpretability for Cross-Modality Synthetic Aperture Radar and Optical Land Cover Segmentation},
  author = {Debopom Sutradhar and Arefin Ittesafun Abian and Mohaimenul Azam Khan Raiaan and Reem E. Mohamed and Sheikh Izzal Azid and Sami Azam},
  journal= {arXiv preprint arXiv:2509.11952},
  year   = {2025}
}

备注

23 pages, 6 figures, 10 tables