中文

基于 Vision Transformer (ViT) 的 EVAP 模型结合 Sentinel-2 与 Formosat-5 影像的灾后受灾区域分割

计算机视觉与模式识别 2026-03-10 v2 人工智能

摘要

我们提出了一种基于 Vision Transformer (ViT) 的深度学习框架,以优化遥感影像中的受灾区域分割,旨在支持并增强由台湾太空中心(TASA)开发的应急增值产品(EVAP)。该流程从一小部分人工标注区域开始。随后,我们应用基于主成分分析(PCA)的特征空间分析并构建置信指数(CI)以扩展这些标签,从而生成一个弱监督训练集。这些扩展后的标签随后被用于训练基于 ViT 的编码器-解码器模型,模型的输入为来自 Sentinel-2 和 Formosat-5 影像的多波段数据。我们的架构支持多种解码器变体和多阶段损失策略,以在有限监督下提升性能。在评估阶段,将模型预测结果与更高分辨率的 EVAP 输出进行比较,以评估空间连贯性和分割一致性。在 2022 年鄱阳湖干旱和 2023 年罗德岛野火上的案例研究表明,我们的框架提升了分割结果的平滑度与可靠性,为在缺乏准确真实标注时的灾害测绘提供了一种可扩展的方法。

关键词

引用

@article{arxiv.2507.16849,
  title  = {Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery},
  author = {Yi-Shan Chu and Hsuan-Cheng Wei},
  journal= {arXiv preprint arXiv:2507.16849},
  year   = {2026}
}