中文

VistaFormer:用于卫星图像时间序列分割的可扩展视觉 Transformer

计算机视觉与模式识别 2024-09-16 v1

摘要

我们介绍了 VistaFormer,一种用于遥感图像语义分割的轻量级 Transformer 模型架构。该模型使用基于多尺度 Transformer 的编码器和轻量级解码器,聚合编码器块中捕获的全局和局部注意力。VistaFormer 使用无位置自注意力层,这简化了模型架构并消除了对时间和空间编码进行插值的需求,当训练和测试图像分辨率不同时,这种插值可能会降低模型性能。我们研究了过滤云等噪声输入信号的简单技术,并证明通过用邻域注意力替代多头自注意力可以实现更好的模型可扩展性。在 PASTIS 和 MTLCC 作物类型分割基准上的实验表明,VistaFormer 实现了比同类模型更好的性能,使用 MHSA 仅需 8% 的浮点运算,使用 NA 仅需 11%,同时使用的可训练参数更少。带有 MHSA 的 VistaFormer 在 PASTIS 基准上将最先进的 mIoU 分数提高了 0.1%,在 MTLCC 基准上提高了 3%,而带有 NA 的 VistaFormer 在 MTLCC 基准上提高了 3.7%。

关键词

引用

@article{arxiv.2409.08461,
  title  = {VistaFormer: Scalable Vision Transformers for Satellite Image Time Series Segmentation},
  author = {Ezra MacDonald and Derek Jacoby and Yvonne Coady},
  journal= {arXiv preprint arXiv:2409.08461},
  year   = {2024}
}