中文

知识迁移预训练

机器学习 2015-06-09 v1 神经与进化计算 机器学习

摘要

预训练对于学习深度神经网络至关重要。大多数现有预训练方法训练简单模型(如受限玻尔兹曼机),然后将其逐层堆叠形成深层结构。这种逐层预训练已有坚实的理论基础和广泛的经验支持。然而,这种方法不易用于预训练没有明确多层结构的模型,例如循环神经网络(RNNs)。本文提出一种基于知识迁移学习的新的预训练方法。与增量训练模型组件的逐层方法不同,新方法将整个模型作为一个整体训练,但使用更简单的目标函数。这是通过利用先前训练模型(教师模型)产生的软目标实现的。与传统的逐层方法相比,新方法不关心模型结构,因此可用于预训练非常复杂的模型。在语音识别任务上的实验表明,使用该方法,复杂的RNN可以用较弱的深度神经网络(DNN)模型很好地训练。此外,新方法可与传统的逐层预训练结合以带来额外收益。

关键词

引用

@article{arxiv.1506.02256,
  title  = {Knowledge Transfer Pre-training},
  author = {Zhiyuan Tang and Dong Wang and Yiqiao Pan and Zhiyong Zhang},
  journal= {arXiv preprint arXiv:1506.02256},
  year   = {2015}
}

备注

arXiv admin note: text overlap with arXiv:1505.04630