中文

LEFormer:一种用于遥感影像精确湖泊提取的 CNN-Transformer 混合架构

计算机视觉与模式识别 2024-01-09 v2

摘要

由于湖泊形状复杂和固有数据噪声,从遥感影像中提取湖泊具有挑战性。现有方法存在分割边界模糊和前景建模差的问题。本文提出一种称为 LEFormer 的 CNN-Transformer 混合架构,用于精确湖泊提取。LEFormer 包含三个主要模块:CNN 编码器、Transformer 编码器和跨编码器融合。CNN 编码器有效恢复局部空间信息并改善细粒度细节。同时,Transformer 编码器捕获任意长度序列间的长程依赖,使其获得全局特征和上下文信息。跨编码器融合模块整合局部与全局特征以改进掩码预测。实验结果表明,LEFormer 在 Surface Water 和青藏高原湖泊数据集上持续达到最先进性能和效率。具体而言,LEFormer 在两个数据集上分别以 3.61M 的参数量取得 90.86% 和 97.42% 的 mIoU,且比先前最佳湖泊提取方法少 20 个参数。源代码见 https://github.com/BastianChen/LEFormer。

关键词

引用

@article{arxiv.2308.04397,
  title  = {LEFormer: A Hybrid CNN-Transformer Architecture for Accurate Lake Extraction from Remote Sensing Imagery},
  author = {Ben Chen and Xuechao Zou and Yu Zhang and Jiayu Li and Kai Li and Junliang Xing and Pin Tao},
  journal= {arXiv preprint arXiv:2308.04397},
  year   = {2024}
}

备注

Accepted by ICASSP 2024