中文

RemoteSAM:迈向地球观测的分割一切

计算机视觉与模式识别 2025-06-03 v3

摘要

我们旨在开发一个鲁棒且灵活的视觉基础模型用于地球观测。它应具备强大的识别和定位多样化视觉目标的能力,同时提供与不同任务场景所需的多种输入-输出接口的兼容性。当前系统无法满足这些要求,因为它们通常利用在狭窄数据域上训练的特定任务架构,且语义覆盖范围有限。我们从数据和建模两个方面解决这些限制。首先,我们引入了一个自动数据引擎,其可扩展性显著优于先前的人工标注或基于规则的方法。这使我们能够创建迄今为止最大规模的数据集,包含270K个图像-文本-掩码三元组,覆盖了前所未有的多样化语义类别和属性规格。基于这一数据基础,我们进一步提出了一种以指代表达分割为中心的任务统一范式。它使用单个模型而无需任何特定任务头,有效地处理了广泛的视觉中心感知任务,包括分类、检测、分割、定位等。结合数据和建模方面的这些创新,我们提出了RemoteSAM,一个在多个地球观测感知基准测试上建立了新最先进性能(SOTA)的基础模型,在显著更高的效率下超越了Falcon、GeoChat和LHRS-Bot等其他基础模型。模型和数据在 https://github.com/1e12Leon/RemoteSAM 上公开发布。

关键词

引用

@article{arxiv.2505.18022,
  title  = {RemoteSAM: Towards Segment Anything for Earth Observation},
  author = {Liang Yao and Fan Liu and Delong Chen and Chuanyi Zhang and Yijun Wang and Ziyun Chen and Wei Xu and Shimin Di and Yuhui Zheng},
  journal= {arXiv preprint arXiv:2505.18022},
  year   = {2025}
}