中文

MPerS:基于动态 MLLM MixExperts 的感知引导遥感场景分段

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

图像和场景标题的多模态融合已被广泛探索并应用于各类领域。然而,在处理复杂遥感场景时,现有研究主要集中于优化架构以整合文本语义信息与视觉特征,却很少关注生成高质量遥感标题以及这些标题在多模态语义融合中的有效性。针对这一问题,我们提出了一种称为 MPerS 的 Dynamic MLLM Mixture-of-Experts Perception-Guided Remote Sensing Scene Segmentation 方法。我们设计了多个提示,使 MLLMs 能够从多样化的专家视角感知遥感场景,从而生成高质量的遥感标题。采用 DINOv3 提取土地覆盖的稠密视觉表征。我们设计了 Dynamic MixExperts 模块,以适应方式整合最有效的文本语义。构建了 Linguistic Query Guided Attention,以文本语义信息引导视觉特征,实现精确分段。我们使用的 MLLMs 包括 LLaVA、ChatGPT 和 Qwen。在三个公开的语义分割遥感数据集上,我们的方法取得了优异的性能。

关键词

引用

@article{arxiv.2605.10769,
  title  = {MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation},
  author = {Ziyi Wang and Xianping Ma and Ziyao Wang and Hongyang Zhang and Man On Pun},
  journal= {arXiv preprint arXiv:2605.10769},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings. 11 pages, 6 figures