中文

软标签与硬标签训练在神经网络中的理论分析

机器学习 2024-12-13 v1 人工智能

摘要

知识蒸馏——即小型学生模型从预训练的大型教师模型学习——自 \citep{hinton2015distilling} 的奠基性工作以来已取得了显著的经验性成功。尽管已有理论研究探索了知识蒸馏的优势,但一个重要问题仍未得到解答:为何使用软标签训练的教师所需的神经元数量显著少于直接使用硬标签训练小型神经网络?为回答此问,我们首先在二分类问题上使用简单神经网络模型进行实验,结果表明软标签训练在准确率上始终优于硬标签训练,且随数据集难度增加,性能差距会更加明显。我们随后基于二维神经网络模型提供理论依据,具体表明使用梯度下降的软标签训练仅需 O(1γ2ϵ)O\left(\frac{1}{\gamma^2 \epsilon}\right) 个神经元即可实现在多个训练周期内平均分类损失小于某个 ϵ>0\epsilon > 0 的目标,其中 γ\gamma 为限制核的分离边缘。相比之下,硬标签训练需要 O(1γ4ln(1ϵ))O\left(\frac{1}{\gamma^4} \cdot \ln\left(\frac{1}{\epsilon}\right)\right) 个神经元,基于 \citep{ji2020polylogarithmic} 中梯度下降分析的改进版本得出。这意味着当 γϵ\gamma \leq \epsilon,即数据集难以分类时,软标签训练所需的神经元数量可显著低于硬标签训练。最后,我们在深度神经网络上进行实验,进一步验证了这些理论发现。

关键词

引用

@article{arxiv.2412.09579,
  title  = {A Theoretical Analysis of Soft-Label vs Hard-Label Training in Neural Networks},
  author = {Saptarshi Mandal and Xiaojun Lin and R. Srikant},
  journal= {arXiv preprint arXiv:2412.09579},
  year   = {2024}
}

备注

Main Body of the Paper is under Review at L4DC 2025