中文

RS-MTDF:遥感半监督语义分割的多教师蒸馏与融合

计算机视觉与模式识别 2025-06-12 v2

摘要

遥感图像的语义分割对各种应用至关重要,但其性能高度依赖大规模、高质量的像素级标注,而这些标注获取成本高昂且耗时。半监督语义分割(SSS)为缓解这一数据依赖提供了有前景的替代方案。然而,现有SSS方法往往难以应对有限标注数据与丰富无标签数据之间固有的分布不匹配,导致泛化性能不足。为缓解此问题,我们尝试引入预训练于广泛且多样数据集的视觉基础模型(VFMs)到SSS任务中,因为VFMs具备强大的泛化能力,可有效弥合这一分布差距并为SSS提供强大的语义先验。灵感来自此,我们提出RS-MTDF(Multi-Teacher Distillation and Fusion,多教师蒸馏与融合),一种新型框架,利用VFMs嵌入的强大语义知识指导遥感半监督学习。具体而言,RS-MTDF使用多个冻结的VFMs(例如DINOv2和CLIP)作为专家教师,采用特征级蒸馏对齐学生特征与其稳健表示。为进一步增强判别能力,蒸馏知识被无缝融合到学生解码器中。在三个具有挑战性的遥感数据集上进行大量实验,表明RS-MTDF始终实现了状态的最佳性能。值得注意的是,我们的方法在LoveDA上在各种标签比例下均优于现有方法,并在大多数语义类别中获得最高的平均交并比(IoU)。这些结果凸显了多教师VFM指导在显著提升遥感分割泛化性和语义理解方面的有效性。消融研究进一步验证了每个提议模块的贡献。

关键词

引用

@article{arxiv.2506.08772,
  title  = {RS-MTDF: Multi-Teacher Distillation and Fusion for Remote Sensing Semi-Supervised Semantic Segmentation},
  author = {Jiayi Song and Kaiyu Li and Xiangyong Cao and Deyu Meng},
  journal= {arXiv preprint arXiv:2506.08772},
  year   = {2025}
}