基于不平衡知识驱动多模态网络的影像与 LiDAR 点云土地覆盖语义分割
图像与视频处理
2024-04-16 v1
摘要
尽管单模态分割已取得良好结果,但单个数据固有的局限性增加了性能取得突破的难度。因此,多模态学习在遥感领域正得到越来越多的探索。现有多模态方法通常将高维特征映射到低维空间作为特征提取前的预处理,以解决不可忽略的域间隙,这不可避免地导致信息损失。为解决此问题,本文提出新颖的不平衡知识驱动多模态网络(IKD-Net),直接从原始多模态异构数据中提取特征。IKD-Net 能够挖掘跨模态的不平衡信息,同时通过两个精巧的即插即用模块——全局知识引导(GKG)和类别知识引导(CKG)门控模块,从全局和类别视角利用强模态驱动弱模态的特征图精炼。随后使用整体损失函数优化整个网络。在开发 IKD-Net 期间,我们还建立了一个名为加州国家农业影像计划与 3D 高程计划联合数据集(N3C-California)的新数据集,为多模态联合分割任务提供了特定基准。在我们的实验中,IKD-Net 在 N3C-California 和小规模 ISPRS Vaihingen 数据集上均优于基准和 SOTA 方法。截至本文投稿时,IKD-Net 在 GRSS DFC 2018 挑战评估的实时排行榜上位居第一。
引用
@article{arxiv.2303.15777,
title = {Imbalance Knowledge-Driven Multi-modal Network for Land-Cover Semantic Segmentation Using Images and LiDAR Point Clouds},
author = {Yameng Wang and Yi Wan and Yongjun Zhang and Bin Zhang and Zhi Gao},
journal= {arXiv preprint arXiv:2303.15777},
year = {2024}
}