SegEarth-OV3:探索 SAM 3 在遥感图像开放词汇语义分割中的应用
计算机视觉与模式识别
2026-04-23 v2
摘要
大多数现有的无训练开放词汇语义分割方法均基于 CLIP。尽管这些方法已取得进展,但它们在精确定位方面往往面临挑战,或需要复杂的流水线来组合独立模块,尤其是在存在大量密集且小目标的遥感场景中。最近,Segment Anything Model 3(SAM 3)被提出,通过可提示框架统一了分割与识别。在本文中,我们全面探索了将 SAM 3 应用于遥感开放词汇任务(即 2D 语义分割、变化检测和 3D 语义分割)而无需任何训练的方法。首先,我们实现了一种掩码融合策略,结合 SAM 3 的语义分割头和 Transformer 解码器(实例头)的输出。这使我们能够利用两个头的优势以实现更好的土地覆盖。其次,我们利用存在头的存在分数来过滤场景中存在的类别,减少由大规模词汇量和地理场景中的块级处理引起的误报。此外,我们通过直接基于融合对数几率的联合实例级和像素级验证策略,将方法扩展至开放词汇变化检测。我们在广泛的遥感数据集和任务上评估了所提出的方法,包括 20 个分割数据集、3 个变化检测数据集和一个 3D 分割数据集。实验表明,我们的方法取得了有前景的性能,展示了 SAM 3 在遥感开放词汇任务中的潜力。我们的代码已发布于 https://github.com/earth-insights/SegEarth-OV-3。
引用
@article{arxiv.2512.08730,
title = {SegEarth-OV3: Exploring SAM 3 for Open-Vocabulary Semantic Segmentation in Remote Sensing Images},
author = {Kaiyu Li and Shengqi Zhang and Yujie Wang and Yupeng Deng and Zhi Wang and Deyu Meng and Xiangyong Cao},
journal= {arXiv preprint arXiv:2512.08730},
year = {2026}
}