中文

长短期样本蒸馏

计算机视觉与模式识别 2020-03-03 v1 计算与语言

摘要

在过去十年中,训练日益深度的神经网络取得了实质性进展。教师—学生训练范式中的近期进展已表明,关于过往训练更新的信息有望作为后续训练步骤的指导来源。基于这一观念,在本文中,我们提出长短期样本蒸馏,一种新颖的训练策略,它同时利用先前训练过程的多个阶段来指导神经网络后续的训练更新,同时在单次生成过程中高效推进。通过长短期样本蒸馏,每个样本的监督信号被分解为两部分:长期信号与短期信号。长期教师借鉴若干轮纪元前的快照以提供稳健指导并保证教师—学生差异,而短期教师产生更及时的线索以实现更高质量的更新。此外,每个样本的教师都是唯一的,从而整体上模型从一组非常多样的教师中学习。跨一系列视觉与 NLP 任务的全面实验结果证明了这一新训练方法的有效性。

关键词

引用

@article{arxiv.2003.00739,
  title  = {Long Short-Term Sample Distillation},
  author = {Liang Jiang and Zujie Wen and Zhongping Liang and Yafang Wang and Gerard de Melo and Zhe Li and Liangzhuang Ma and Jiaxing Zhang and Xiaolong Li and Yuan Qi},
  journal= {arXiv preprint arXiv:2003.00739},
  year   = {2020}
}

备注

published as a conference paper at AAAI 2020