用于高分辨率土地沉降预测的多模态时空Transformer
计算机视觉与模式识别
2025-10-02 v2 人工智能
摘要
预测高分辨率土地沉降是关键且具有挑战性的任务,由于其复杂的非线性动力学。虽然标准体系结构如ConvLSTM常常难以建模长程依赖关系,但我们认为,先前工作的根本性限制在于单模态数据范式。为此,我们提出了多模态时空Transformer(MM-STT),一种新型框架,将动态位移数据与静态物理先验相融合。其核心创新是联合时空注意力机制,以统一方式处理所有多模态特征。在公开的EGMS数据集上,MM-STT建立了新的最先进成果,使包括STGCN和STAEformer等SOTA方法在内的所有基线的长期预测RMSE降低了一个数量级。我们的结果表明,对于这类问题,体系结构在深度多模态融合方面的固有能力对于实现变革性性能至关重要。
引用
@article{arxiv.2509.25393,
title = {Multi-modal Spatio-Temporal Transformer for High-resolution Land Subsidence Prediction},
author = {Wendong Yao and Binhua Huang and Soumyabrata Dev},
journal= {arXiv preprint arXiv:2509.25393},
year = {2025}
}
备注
This paper is submitted to IEEE Transactions on Geoscience and Remote Sensing for reviewing