中文

用于卫星图像时间序列的视觉Transformer

计算机视觉与模式识别 2023-04-17 v3 机器学习

摘要

本文介绍了一种基于视觉Transformer(ViT)的、用于通用卫星图像时间序列(SITS)处理的完全注意力模型——时空视觉Transformer(TSViT)。TSViT将SITS记录在空间和时间上分割成不重叠的图块,这些图块被标记化后,由一个分解的时空编码器进行处理。我们认为,与自然图像相比,先时间后空间的分解方式对于SITS处理更为直观,并为此提供了实验证据。此外,我们通过引入两种新颖的机制——采集时间特定的时间位置编码和多个可学习的类别标记——来增强模型的判别能力。所有新颖设计选择的效果都通过广泛的消融研究进行了评估。我们提出的架构在三个公开可用的SITS语义分割和分类数据集上达到了最先进的性能,以显著优势超越了先前的方法。所有模型、训练和评估代码均已公开,以促进进一步的研究。

关键词

引用

@article{arxiv.2301.04944,
  title  = {ViTs for SITS: Vision Transformers for Satellite Image Time Series},
  author = {Michail Tarasiou and Erik Chavez and Stefanos Zafeiriou},
  journal= {arXiv preprint arXiv:2301.04944},
  year   = {2023}
}

备注

11 pages, 5 figures, 2 tables