迈向逼真的开放词汇遥感分割:基准与基线
计算机视觉与模式识别
2026-04-20 v1
摘要
由于数据集碎片化、训练多样性有限以及缺乏反映现实地理空间应用需求的评估基准,开放词汇遥感图像分割(OVRSIS)仍处于探索不足的状态。我们之前的 OVRSISBenchV1 建立了一个初步的跨数据集评估协议,但其有限的范围不足以评估逼真的开放世界泛化能力。为解决此问题,我们提出了 OVRSISBenchV2,这是一个面向 OVRSIS 的大规模、应用导向的基准。我们首先构建了 OVRSIS95K,这是一个平衡的数据集,包含约 95,000 个图像-掩码对,覆盖了不同遥感场景中的 35 个常见语义类别。基于 OVRSIS95K 和 10 个下游数据集,OVRSISBenchV2 包含 170,000 张图像和 128 个类别,大幅扩展了场景多样性、语义覆盖范围和评估难度。除了标准的开放词汇分割,它还包括用于建筑物提取、道路提取和洪水检测的下游协议,从而更好地反映现实的地理空间应用需求和复杂的部署场景。我们还提出了 Pi-Seg,一个 OVRSIS 的基线。Pi-Seg 通过一个正激励噪声机制来提高可迁移性,在该机制中,可学习的、语义引导的扰动在训练期间拓宽了视觉-文本特征空间。在 OVRSISBenchV1、OVRSISBenchV2 和下游任务上的大量实验表明,Pi-Seg 提供了强大且一致的结果,尤其是在更具挑战性的 OVRSISBenchV2 基准上。我们的结果突显了逼真基准设计的重要性以及基于扰动的迁移对 OVRSIS 的有效性。代码和数据集可在 https://github.com/LiBingyu01/RSKT-Seg/tree/Pi-Seg 获取。
引用
@article{arxiv.2604.15652,
title = {Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline},
author = {Bingyu Li and Tao Huo and Haocheng Dong and Da Zhang and Zhiyuan Zhao and Junyu Gao and Xuelong Li},
journal= {arXiv preprint arXiv:2604.15652},
year = {2026}
}