中文

MVT:用于分类对齐土地覆盖标注的掩蔽锚定视觉语言模型

计算机视觉与模式识别 2026-01-09 v3

摘要

遥感中的土地覆盖理解日益需要类别无关的系统,这些系统能够跨数据集泛化,同时保持空间上的精确性和可解释性。我们研究了领域偏移下以几何为先的发现与解释设定,其中候选区域以类别无关的方式进行勾画,并且监督通过匿名标识符避免使用词汇类别名。作为开放集识别和开放世界学习的补充,我们专注于将类别无关的掩蔽证据与基于分类体系的场景解释相耦合,而不是未知拒绝或持续类别扩展。我们提出了 MVT,一个三阶段框架:(i) 使用带有领域自适应的 SAM2 提取边界保真的区域掩蔽;(ii) 通过多模态 LLM 的双步 LoRA 微调,执行掩蔽锚定的语义标注和场景描述生成;(iii) 使用由分层专家评分校准的 LLM-as-judge 评分评估输出。在跨数据集分割迁移任务上(在 OpenEarthMap 上训练,在 LoveDA 上评估),领域自适应的 SAM2 提高了掩蔽质量;同时,双步 MLLM 微调产生了更准确的分类对齐标签和更具信息量的掩蔽锚定场景描述。

关键词

引用

@article{arxiv.2509.18693,
  title  = {MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging},
  author = {Siyi Chen and Kai Wang and Weicong Pang and Ruiming Yang and Ziru Chen and Renjun Gao and Alexis Kai Hon Lau and Dasa Gu and Chenchen Zhang and Cheng Li},
  journal= {arXiv preprint arXiv:2509.18693},
  year   = {2026}
}

备注

The project is available at https://charlescsyyy.github.io/MVT