中文

带噪声高斯混合模型中最优自蒸馏的影响

机器学习 2025-11-20 v4 无序系统与神经网络 机器学习

摘要

自蒸馏(SD)是一种模型通过自身预测改进自己的技术,因其简单而强大而受到关注。尽管其应用广泛,但其有效性背后的机制仍不明确。本研究针对在带噪声高斯混合数据上使用线性分类器进行二分类的调参多阶段SD有效性进行了调查。为此,我们采用统计物理中的复制方法进行分析。我们的发现表明,SD性能提升的主要驱动力是通过硬伪标签进行去噪,在中等规模数据集中效果最为显著。我们还识别了两种实用技巧来增强SD:一种是限制阶段数量的提前停止,效果广泛有效;另一种是固定偏置参数,有助于解决标签不平衡问题。为验证我们从玩具模型中得出的理论结果,我们在使用预训练ResNet backbone进行CIFAR-10分类的实验中进行了额外实验。这些结果提供了理论和实践上的见解,推动了在噪声环境中SD的理解和应用。

关键词

引用

@article{arxiv.2501.16226,
  title  = {The Effect of Optimal Self-Distillation in Noisy Gaussian Mixture Model},
  author = {Kaito Takanami and Takashi Takahashi and Ayaka Sakata},
  journal= {arXiv preprint arXiv:2501.16226},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025