中文

使用EfficientUNets与Transformers的高分辨率图像语义标注

计算机视觉与模式识别 2023-07-19 v2 图像与视频处理

摘要

语义分割需要能够在处理海量数据的同时学习高层特征的方法。卷积神经网络(CNNs)可以学习独特且自适应的特征以实现此目标。然而,由于遥感图像尺寸大且空间分辨率高,这些网络无法高效分析整个场景。近来,深度transformers已证明其能够记录图像中不同对象之间的全局交互。本文中,我们提出一种结合卷积神经网络与transformers的新分割模型,并表明这种局部与全局特征提取技术的混合在遥感分割中提供了显著优势。此外,所提模型包含两个融合层,旨在高效表示网络的多模态输入与输出。输入融合层提取总结图像内容与高程图(DSM)之间关系的特征图。输出融合层使用一种新颖的多任务分割策略,其中类标签通过类特定特征提取层与损失函数识别。最后,采用快速行进法将所有未识别类标签转换为其最近的已知邻类。我们的结果表明,相较于最先进的技术,所提方法提高了分割精度。

关键词

引用

@article{arxiv.2206.09731,
  title  = {Semantic Labeling of High Resolution Images Using EfficientUNets and Transformers},
  author = {Hasan AlMarzouqi and Lyes Saad Saoud},
  journal= {arXiv preprint arXiv:2206.09731},
  year   = {2023}
}