中文

MM-OVSeg:遥感开放词典分割的多模态光SAR融合

计算机视觉与模式识别 2026-03-30 v2

摘要

开放词典分割实现了来自开放文本类别集合的像素级识别,允许超越固定类别的泛化。尽管在遥感领域具有巨大的潜力,但当前该领域的进展主要局限于清晰天气下的光学数据,在受云层或雾霾影响的条件下仍显不足。我们提出MM-OVSeg,一种针对恶劣天气条件下开放词典分割的多模态光SAR融合框架。MM-OVSeg利用两种模态的互补优势——光学图像提供丰富的光谱语义,而合成孔径雷达(SAR)提供穿透云层的结构线索。为解决跨模态域间隙和当前视觉语言模型稀疏预测能力不足的问题,本文提出两种关键设计:一种用于多传感器表示对齐的跨模态统一过程,以及一种集成来自多个视觉基础模型层次特征的双编码器融合模块,用于文本对齐的多模态分割。大量实验表明,MM-OVSeg在多样化云层条件下实现了卓越的鲁棒性和泛化能力。数据集和代码已发布于https://github.com/Jimmyxichen/MM-OVSeg。

关键词

引用

@article{arxiv.2603.17528,
  title  = {MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing},
  author = {Yimin Wei and Aoran Xiao and Hongruixuan Chen and Junshi Xia and Naoto Yokoya},
  journal= {arXiv preprint arXiv:2603.17528},
  year   = {2026}
}

备注

CVPR2026