中文

通用多模态Transformer应用于遥感语义分割

计算机视觉与模式识别 2023-07-10 v1

摘要

高分辨率多光谱/高光谱传感器、LiDAR DSM(数字表面模型)信息等诸多数据源的出现,为我们提供了前所未有的地球观测数据财富。多模态AI致力于利用这些互补数据源,尤其是针对语义分割等复杂任务。尽管已开发出专用架构,但它们通过大量的模型设计工作而高度复杂,且每当新模态出现时都需要大量重新设计。近期通用多模态网络的趋势已展现出以统一架构在多个多模态任务上达到最先进(SOTA)性能的潜力。在本工作中,我们研究了通用多模态家族中的PerceiverIO在遥感语义分割领域的性能。我们的实验揭示,这一表面通用的网络难以应对遥感图像中目标尺度变化,且无法从俯视视角检测车辆存在。为解决这些问题,即便存在极端的类别不平衡问题,我们提出了一种空间与体积学习组件。具体而言,我们设计了一个受UNet启发的模块,采用3D卷积编码重要的局部信息并同时学习跨模态特征,同时通过PerceiverIO的交叉注意力机制降低网络计算负担。所提组件的有效性通过与其他方法(如2D卷积、双局部模块(即受UNetFormer启发的Conv2D 1x1与Conv2D 3x3组合))的广泛对比实验得到验证。所提方法取得了与UNetFormer、SwinUNet等专用架构相竞争的结果,显示出其在最小性能折衷下减少网络架构设计工作的潜力。

关键词

引用

@article{arxiv.2307.03388,
  title  = {General-Purpose Multimodal Transformer meets Remote Sensing Semantic Segmentation},
  author = {Nhi Kieu and Kien Nguyen and Sridha Sridharan and Clinton Fookes},
  journal= {arXiv preprint arXiv:2307.03388},
  year   = {2023}
}

备注

Accepted to CVPR Workshop on Multimodal Learning for Earth and Environment 2023