中文

GeoSAM:利用多模态提示微调 SAM 用于移动基础设施分割

计算机视觉与模式识别 2025-08-19 v4 人工智能

摘要

在地理图像分割中,性能常受训练数据有限和泛化性不足的制约,尤其是对于道路、人行道和人行横道等移动基础设施的分割。像 Segment Anything Model (SAM) 这类在数百万自然图像上预训练的视觉基础模型已展现出令人印象深刻的零样本分割性能,提供了一种潜在解决方案。然而,由于 SAM 的训练仅限于自然图像,且这些目标狭窄的特征与纹理融入背景,其在航空和卫星影像等地理图像上表现不佳。为应对这些挑战,我们提出地理 SAM (GeoSAM),一种基于 SAM 并利用自动生成的多模态提示微调 SAM 的框架。具体而言,GeoSAM 整合来自预训练任务特定模型的点提示作为主视觉引导,以及由大语言模型生成的文本提示作为辅语义引导,使模型能更好地捕捉空间结构与上下文含义。GeoSAM 在熟悉和完全未见区域上的移动基础设施分割任务中均超越现有方法至少 5\% 的 mIoU,代表了在利用基础模型分割地理图像中包括道路与步行基础设施在内的移动基础设施方面的显著飞跃。源代码可在此 GitHub 仓库找到:https://github.com/rafiibnsultan/GeoSAM。

关键词

引用

@article{arxiv.2311.11319,
  title  = {GeoSAM: Fine-tuning SAM with Multi-Modal Prompts for Mobility Infrastructure Segmentation},
  author = {Rafi Ibn Sultan and Chengyin Li and Hui Zhu and Prashant Khanduri and Marco Brocanelli and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2311.11319},
  year   = {2025}
}

备注

Accepted by European Conference on Artificial Intelligence (ECAI 2025)