中文

PHI-S:面向无标签多教师蒸馏的分布平衡

机器学习 2024-10-03 v1 人工智能 计算机视觉与模式识别

摘要

各种视觉基础模型具有不同的优势和劣势,两者都可以通过无标签的异构多教师知识蒸馏(称为“聚合模型”)得到改进。我们在此工作基础上,研究教师激活统计量的影响,特别是损失函数对最终学生模型质量的影响。我们探索了一套标准的统计归一化技术,以更好地对齐不同的分布并评估其效果。此外,我们研究了对下游教师匹配指标的影响,这促使我们使用Hadamard矩阵。利用这些矩阵,我们展示了有用的性质,说明了如何将它们用于各向同性标准化,其中多元分布的每个维度都使用相同的尺度进行标准化。我们将这种技术称为“PHI标准化”,并通过实验证明,在所研究的一系列方法中,它产生了最佳的学生模型。

关键词

引用

@article{arxiv.2410.01680,
  title  = {PHI-S: Distribution Balancing for Label-Free Multi-Teacher Distillation},
  author = {Mike Ranzinger and Jon Barker and Greg Heinrich and Pavlo Molchanov and Bryan Catanzaro and Andrew Tao},
  journal= {arXiv preprint arXiv:2410.01680},
  year   = {2024}
}