中文

理解情景式元训练的过拟合

机器学习 2023-07-10 v2 计算机视觉与模式识别

摘要

尽管两阶段少样本分类方法取得了成功,在情景式元训练阶段,模型遭受严重的过拟合。我们假设这是由过度判别引起的,即模型学习到过度依赖适用于基类判别的表层特征,同时抑制了新类的泛化能力。为惩罚过度判别,我们引入知识蒸馏技术,在训练期间保留来自教师模型的新类泛化知识。具体而言,我们选择元训练期间验证精度最佳的教师模型,并限制教师模型线性分类器输出分布与学生模型输出分布之间的对称 Kullback-Leibler(SKL)散度。这一简单方法优于标准元训练过程。我们进一步提出用于元训练的最近邻对称 Kullback-Leibler(NNSKL)散度,以推进知识蒸馏技术的极限。NNSKL 以少样本任务作为输入,并惩罚最近邻分类器的输出,该输出对查询嵌入与支持中心之间的关系产生影响。通过在元训练中结合 SKL 与 NNSKL,模型取得了更好的性能,并在多个基准上超越了最先进的结果。

关键词

引用

@article{arxiv.2306.16873,
  title  = {Understanding the Overfitting of the Episodic Meta-training},
  author = {Siqi Hui and Sanping Zhou and Ye deng and Jinjun Wang},
  journal= {arXiv preprint arXiv:2306.16873},
  year   = {2023}
}