中文

基于多尺度视觉变换器的多模态 GeoAI 模型用于阿拉斯加积雪冻土勘测

计算机视觉与模式识别 2025-04-28 v1 人工智能

摘要

阿拉斯加地区的逆退化冻土坡 (Retrogressive Thaw Slumps, RTS) 是具有显著环境影响的独特冻土地形。 accurately mapping RTS 至关重要,因为其外观是冻土解冻的明显指示。然而,由于其尺寸较其他地形特征小、边界模糊以及时空变化,准确检测 RTS 面临重大挑战。本文采用最先进的深度学习模型——具有多尺度视觉变换器 backbone 的 Cascade Mask R-CNN,用于全域勘测 RTS 特征。引入了两项新策略以优化多模态学习并提升模型预测性能:(1) 基于特征层的残差跨模态注意力融合策略,有效整合来自多个模态的特征图以捕捉互补信息,增强模型理解复杂数据中模式与关系的能力;(2) 采用预训练的单模态学习再进行多模态微调,以减轻计算需求同时实现卓越的模型性能。实验结果表明,我们的方法在采用数据级融合、特征级卷积融合和各种注意力融合策略的现有模型之上显著优于后者,为高效利用多模态数据进行 RTS 勘测提供了宝贵的见解。该研究有助于我们对冻土地形及其环境影响的理解。

关键词

引用

@article{arxiv.2504.17822,
  title  = {A multi-scale vision transformer-based multimodal GeoAI model for mapping Arctic permafrost thaw},
  author = {Wenwen Li and Chia-Yu Hsu and Sizhe Wang and Zhining Gu and Yili Yang and Brendan M. Rogers and Anna Liljedahl},
  journal= {arXiv preprint arXiv:2504.17822},
  year   = {2025}
}