中文

BuildMamba:基于视觉状态空间模型的多任务建筑分割与卫星图像高度估计

计算机视觉与模式识别 2026-03-10 v1

摘要

从单视图 RGB 卫星图像上准确进行建筑分割和高度估计是城市分析的基本任务,但由于结构变异性和全局上下文建模的高计算成本,仍然面临挑战。虽然当前方法通常借鉴单目深度架构,但常常 suffer from 边界泄漏和对高层建筑的系统性低估。为解决这些限制,我们提出 BuildMamba,一个统一的多任务框架,旨在利用视觉状态空间模型的线性时间全局建模。为了实现更强的结构耦合和计算效率,我们引入三个模块:用于动态空间重标定的 Mamba 注意力模块、通过门控状态空间扫描实现多尺度特征聚合的 Spatial-Aware Mamba-FPN,以及利用语义先验抑制高度伪影的掩码感知高度细化模块。大量实验表明,BuildMamba 在三个基准数据集上建立了新的性能上限。具体而言,在 DFC23 数据集上实现了 0.93 的 IoU 和 1.77~米的 RMSE,在高度估计方面超越了最先进方法 0.82~米。仿真结果确认该模型在大规模三维城市重建中具有卓越的鲁棒性和可扩展性。

关键词

引用

@article{arxiv.2603.08523,
  title  = {BuildMamba: A Visual State-Space Based Model for Multi-Task Building Segmentation and Height Estimation from Satellite Images},
  author = {Sinan U. Ulu and A. Enes Doruk and I. Can Yagmur and Bahadir K. Gunturk and Oguz Hanoglu and Hasan F. Ates},
  journal= {arXiv preprint arXiv:2603.08523},
  year   = {2026}
}