中文

基于视觉Transformer的建筑物提取

计算机视觉与模式识别 2022-08-10 v2

摘要

作为人类生产活动的重要载体,建筑物的提取不仅对城市动态监测至关重要,也是郊区建设核查所必需的。当前,由于背景复杂及建筑物外观多样,从遥感影像中精确提取建筑物仍具挑战。基于卷积神经网络(CNN)的建筑物提取方法虽显著提升了精度,却因难以建模全局依赖而受诟病。因此,本文应用视觉Transformer(Vision Transformer)进行建筑物提取。然而,Vision Transformer的实际使用常存在两点局限。其一,与CNN相比,Vision Transformer需要更多GPU显存与计算开销,当面对细分辨率遥感影像等大尺寸输入时此局限更被放大。其二,Vision Transformer在特征提取过程中空间细节保留不足,导致细粒度建筑物分割能力欠缺。为应对这些问题,我们提出一种具有双路径结构的新型Vision Transformer(BuildFormer)。具体而言,我们设计了空间细节上下文路径以编码丰富空间细节,以及全局上下文路径以捕获全局依赖。此外,我们开发了基于窗口的线性多头自注意力,使多头自注意力的复杂度随窗口大小线性增长,从而利用大窗口强化全局上下文提取,并大幅提升Vision Transformer处理大尺寸遥感影像的潜力。所提方法在Massachusetts建筑物数据集上取得了当前最优性能(75.74% IoU)。代码将公开。

关键词

引用

@article{arxiv.2111.15637,
  title  = {Building extraction with vision transformer},
  author = {Libo Wang and Shenghui Fang and Rui Li and Xiaoliang Meng},
  journal= {arXiv preprint arXiv:2111.15637},
  year   = {2022}
}

备注

Submitted to TGRS