中文

面向语义分割中多模态与缺失模态场景的基于对比学习的光谱知识蒸馏

计算机视觉与模式识别 2023-12-06 v1 人工智能

摘要

利用多光谱信息提升语义分割模型的性能至关重要,尤其是在低光照和恶劣条件下。多模态融合技术要么追求学习跨模态特征以生成融合图像,要么采用知识蒸馏,但将多模态和缺失模态场景作为独立问题处理,这对于多传感器模型而言并非最优方法。为解决此问题,提出了一种名为 CSK-Net 的新型多模态融合方法,该方法采用基于对比学习的光谱知识蒸馏技术以及自动混合特征交换机制,用于光学(EO)和红外(IR)图像的语义分割。该蒸馏方案从光学图像中提取详细纹理,并将其蒸馏到 CSK-Net 的光学分支中。模型编码器由共享卷积权重和针对两种模态的独立批归一化(BN)层组成,以捕获同一物体不同模态的多光谱信息。提出了一种新型门控光谱单元(GSU)和混合特征交换策略,以在蒸馏过程中增强模态共享信息的相关性并减少模态特定信息。综合实验表明,在三个公开基准数据集上,当仅利用 IR 数据进行推理时,CSK-Net 在多模态任务和缺失模态任务中均超越了现有最先进模型。对于缺失模态场景,与基线分割模型相比,在不增加额外计算成本的情况下即实现了性能提升。

关键词

引用

@article{arxiv.2312.02240,
  title  = {Contrastive Learning-Based Spectral Knowledge Distillation for Multi-Modality and Missing Modality Scenarios in Semantic Segmentation},
  author = {Aniruddh Sikdar and Jayant Teotia and Suresh Sundaram},
  journal= {arXiv preprint arXiv:2312.02240},
  year   = {2023}
}

备注

10 pages, 6 figures