中文

ConInfer:面向免训练开放词汇遥感分割的上下文感知推理

计算机视觉与模式识别 2026-04-01 v1

摘要

由视觉语言模型赋能的免训练开放词汇遥感分割(OVRSS)已成为实现遥感图像类别无关语义理解的有前景范式。现有方法主要关注增强特征表示或缓解模态差异以提高逐块预测精度。然而,此类独立预测方案与遥感数据的内在特征根本不一致。在实际应用中,遥感场景通常是大规模的,并表现出强烈的空间以及语义相关性,使得孤立的逐块预测不足以实现精确分割。为了解决这一局限性,我们提出了ConInfer,一个面向OVRSS的上下文感知推理框架,该框架在多个空间单元之间执行联合预测,同时显式建模它们之间的单元间语义依赖。通过融入全局上下文线索,我们的方法显著增强了复杂遥感环境中的分割一致性、鲁棒性和泛化能力。在多个基准数据集上的广泛实验表明,我们的方法持续超越了现有的基于逐像素VLM的基线方法(如SegEarth-OV),在开放词汇语义分割和目标提取任务上分别实现了平均2.80%和6.13%的提升。实现代码可在以下地址获取:https://github.com/Dog-Yang/ConInfer

关键词

引用

@article{arxiv.2603.29271,
  title  = {ConInfer: Context-Aware Inference for Training-Free Open-Vocabulary Remote Sensing Segmentation},
  author = {Wenyang Chen and Zhanxuan Hu and Yaping Zhang and Hailong Ning and Yonghang Tai},
  journal= {arXiv preprint arXiv:2603.29271},
  year   = {2026}
}