基于视觉Transformer与位置嵌入的全北极多年冻土地貌与人工基础设施特征检测
计算机视觉与模式识别
2025-06-04 v1
摘要
利用亚米级卫星图像在全北极尺度上精确绘制多年冻土地貌、融化扰动和人工基础设施正变得越来越重要。处理拍字节级图像数据需要高性能计算和鲁棒的特征检测模型。虽然基于卷积神经网络(CNN)的深度学习方法广泛用于遥感(RS),但与基于 Transformer 的大型语言模型的成功类似,视觉 Transformer(ViT)通过注意力机制在捕捉长程依赖和全局上下文方面具有优势。ViT 支持通过自监督学习进行预训练——解决了北极特征检测中标注数据常见的局限性,并在基准数据集上优于 CNN。北极地区也对模型泛化提出了挑战,特别是当相同语义类别的特征表现出多样的光谱特性时。为解决北极特征检测中的这些问题,我们将地理空间位置嵌入集成到 ViT 中,以改善跨区域的适应性。本研究探讨了:(1)预训练 ViT 作为高分辨率北极遥感任务特征提取器的适用性,以及(2)结合图像嵌入和位置嵌入的好处。使用先前发布的北极特征检测数据集,我们在三个任务上评估了我们的模型——检测冰楔多边形(IWP)、退行性热融滑塌(RTS)和人工基础设施。我们通过实验探索了多种融合图像嵌入和位置嵌入的配置。结果表明,在三个任务中的两个任务上,带有位置嵌入的 ViT 优于先前的基于 CNN 的模型,包括 RTS 检测的 F1 分数从 0.84 提高到 0.92,展示了具有空间意识的 Transformer 模型在北极遥感应用中的潜力。
引用
@article{arxiv.2506.02868,
title = {Pan-Arctic Permafrost Landform and Human-built Infrastructure Feature Detection with Vision Transformers and Location Embeddings},
author = {Amal S. Perera and David Fernandez and Chandi Witharana and Elias Manos and Michael Pimenta and Anna K. Liljedahl and Ingmar Nitze and Yili Yang and Todd Nicholson and Chia-Yu Hsu and Wenwen Li and Guido Grosse},
journal= {arXiv preprint arXiv:2506.02868},
year = {2025}
}
备注
20 pages, 2 column IEEE format, 13 Figures