中文

视觉 Transformer:一种用于高分辨率大尺度冠层高度制图的新方法

计算机视觉与模式识别 2024-05-27 v1 图像与视频处理

摘要

准确且及时地监测森林冠层高度对于评估森林动态、生物多样性、碳汇以及森林退化与毁林至关重要。深度学习技术的最新进展,加之海量的星载遥感数据,为以高空间与时间分辨率绘制冠层高度图提供了前所未有的机遇。当前用于全覆盖冠层高度制图的技术,将来自光学与雷达传感器的遥感二维信息与利用 LiDAR 测量的树木垂直结构相关联。尽管使用深度学习算法的研究在精确制图冠层高度方面已展现出良好性能,但由于所采用的架构与损失函数类型,它们存在局限。此外,热带森林上的冠层高度制图仍鲜有研究,且高大树冠的精确高度估计因光学与雷达传感器的信号饱和、持续性云覆盖以及有时 LiDAR 有限的穿透能力而成为挑战。在此,我们以一种新的视觉 Transformer(ViT)模型在加纳多样地貌上以 10 m 分辨率绘制高度图,该模型同时使用分类(离散)与回归(连续)损失函数进行优化。此模型比先前使用的仅以连续损失函数优化的基于卷积的方法(ConvNets)达到更高精度。ViT 模型结果表明,我们提出的离散/连续损失显著增强了对非常高树木(即 > 35m)的敏感性,而其他方法对此显示出饱和效应。与卷积模型相比,ViT 生成的的高度图还具有更好的地面采样距离以及对稀疏植被更好的敏感性。我们的 ViT 模型相对于参考数据集的 RMSE 为 3.12m,而 ConvNet 模型的 RMSE 为 4.3m。

关键词

引用

@article{arxiv.2304.11487,
  title  = {Vision Transformers, a new approach for high-resolution and large-scale mapping of canopy heights},
  author = {Ibrahim Fayad and Philippe Ciais and Martin Schwartz and Jean-Pierre Wigneron and Nicolas Baghdadi and Aurélien de Truchis and Alexandre d'Aspremont and Frederic Frappart and Sassan Saatchi and Agnes Pellissier-Tanon and Hassan Bazzi},
  journal= {arXiv preprint arXiv:2304.11487},
  year   = {2024}
}