中文

面向半监督语义分割的三视角知识蒸馏

计算机视觉与模式识别 2025-07-01 v1

摘要

为缓解昂贵的人工标注,半监督语义分割利用少量标注图像和大量未标注图像来预测同尺寸的像素级标签图。以往方法常采用具有相同架构但不同初始化的两个卷积网络进行协同训练,不足以捕获充分多样的特征。这促使我们采用三训练并开发三视角编码器,以利用不同架构的编码器提取多样特征,并借助知识蒸馏技术学习这些编码器间的互补语义。此外,现有方法简单拼接编码器与解码器特征,导致冗余特征并带来较大内存开销。这启发我们设计双频解码器,通过将特征从空间域投影到频域来筛选重要特征,并引入双频通道注意力机制建模特征重要性。因此,我们提出一种称为 TriKD 的三视角知识蒸馏框架用于半监督语义分割,包含三视角编码器与双频解码器。在 Pascal VOC 2012 和 Cityscapes 两个基准上进行了充分实验,结果验证了所提方法在精度与推理速度间良好权衡下的优越性。

关键词

引用

@article{arxiv.2309.12557,
  title  = {Triple-View Knowledge Distillation for Semi-Supervised Semantic Segmentation},
  author = {Ping Li and Junjie Chen and Li Yuan and Xianghua Xu and Mingli Song},
  journal= {arXiv preprint arXiv:2309.12557},
  year   = {2025}
}