语义分割的相对难度蒸馏
计算机视觉与模式识别
2024-07-08 v1
摘要
当前知识蒸馏(Knowledge Distillation, KD)方法主要聚焦于传递各种结构化知识并设计相应的优化目标以鼓励学生网络模仿教师网络的输出。然而,引入过多的额外优化目标可能导致训练不稳定,例如梯度冲突。此外,这些方法忽略了教师网络和学生网络之间相对学习难度的指导方针。受人类认知科学启发,本文从新的视角重新定义知识——学生和教师网络对样本的相对难度,并提出一种用于语义分割的像素级KD范式,称为相对难度蒸馏(Relative Difficulty Distillation, RDD)。我们提出了两个阶段的RDD框架:Teacher-Full Evaluated RDD(TFE-RDD)和Teacher-Student Evaluated RDD(TSE-RDD)。RDD允许教师网络在无需额外优化目标的情况下提供有效的学习重点,从而避免为多个损失函数调整学习权重。在流行数据集如Cityscapes、CamVid、Pascal VOC和ADE20k上的大规模实验评估表明,RDD在使用通用蒸馏损失函数的情况下,优于最先进的KD方法。此外,我们的研究表明RDD可以与现有的KD方法集成,以提高其上限性能。
引用
@article{arxiv.2407.03719,
title = {Relative Difficulty Distillation for Semantic Segmentation},
author = {Dong Liang and Yue Sun and Yun Du and Songcan Chen and Sheng-Jun Huang},
journal= {arXiv preprint arXiv:2407.03719},
year = {2024}
}