时序-空间管状嵌入用于基于 MSI-SAR 融合的云鲁棒 MSI 重建:多头自注意力视频视觉Transformer方法
计算机视觉与模式识别
2025-12-11 v1 人工智能
摘要
多光谱影像(MSI)中的云覆盖通过破坏光谱信息严重阻碍了早期季节作物制图。现有的基于视觉Transformer(ViT)的时间序列重建方法,如 SMTS-ViT,通常采用粗粒度的时序嵌入来聚合整个序列,导致大量信息丢失并降低重建精度。为解决这些限制,本研究提出了一种基于视频视觉Transformer(ViViT)的框架,采用时序-空间融合嵌入,用于云覆盖区域的 MSI 重建。通过 3D 卷积提取非重叠管状片段(tubelets),约束时间跨度 (t=2),在减少跨天信息退化的同时确保局部时序一致性。实验中同时考虑了仅 MSI 和 SAR-MSI 融合两种场景。在 2020 年 Traill County 数据集上的全面实验表明了显著的性能提升:MTS-ViViT 相比 MTS-ViT 基线将 MSE 降低了 2.23%,而 SMTS-ViViT 结合 SAR 集成相比 SMTS-ViT 基线实现了 10.33% 的提升。所提出的框架有效增强了光谱重建质量,实现了鲁棒的农业监测。
引用
@article{arxiv.2512.09471,
title = {Temporal-Spatial Tubelet Embedding for Cloud-Robust MSI Reconstruction using MSI-SAR Fusion: A Multi-Head Self-Attention Video Vision Transformer Approach},
author = {Yiqun Wang and Lujun Li and Meiru Yue and Radu State},
journal= {arXiv preprint arXiv:2512.09471},
year = {2025}
}