实现无训练文本驱动遥感分割
计算机视觉与模式识别
2026-02-23 v1
摘要
近期在视觉语言模型(VLM)和视觉基础模型(VFM)方面的进展为零样本文本引导的遥感图像分割开辟了新机会。然而,大多数现有方法仍依赖额外的可训练组件,限制了其泛化性和实际应用性。本文探讨了在无需额外训练的情况下,是否可以仅依赖现有基础模型实现文本驱动的遥感分割。我们提出一种简单且有效的方法,将对比型和生成式VLM与Segment Anything Model(SAM)集成,实现完全无训练或轻量级LoRA调优的管道。我们的对比方法采用CLIP作为SAM网格化提案的掩码选择器,在完全零样本设置下实现了最先进的开放词汇语义分割(OVSS)。并行地,我们的生成方法通过GPT-5在零样本设置下生成点击提示为SAM提供推理和指代分割,后者采用LoRA调优的Qwen-VL模型,效果最佳。广泛的实验覆盖19个遥感基准,包括开放词汇、指代和推理任务,证明了我们方法的强大能力。代码将在https://github.com/josesosajs/trainfree-rs-segmentation发布。
引用
@article{arxiv.2602.17799,
title = {Enabling Training-Free Text-Based Remote Sensing Segmentation},
author = {Jose Sosa and Danila Rukhovich and Anis Kacem and Djamila Aouada},
journal= {arXiv preprint arXiv:2602.17799},
year = {2026}
}