课程学习在深度网络训练中的威力
机器学习
2020-12-03 v3 机器学习
摘要
神经网络的训练传统上通过提供从整个训练数据中均匀采样的随机小批量序列来完成。本工作中,我们分析了课程学习(涉及小批量的非均匀采样)对深度网络训练的影响,具体而言是针对图像识别训练的 CNN。采用课程学习时,训练算法须解决两个问题:(i) 按难度对训练样本排序;(ii) 计算一系列难度递增的小批量。我们采用两种方法应对挑战(i):从某个有竞争力的“教师”网络迁移学习,以及自举。在我们的实证评估中,两种方法在提升学习速度与改善测试数据上最终性能方面均展现出相似益处。我们通过对不同 pacing 函数的考察应对挑战(ii)以引导采样。实证探究涵盖多种网络架构,使用来自 CIFAR-10、CIFAR-100 及 ImageNet 子集的图像。我们以对课程学习的全新理论分析作结,展示了它如何有效修改优化地形。随后我们定义了理想课程的概念,并表明在温和条件下它不改变相应优化函数的全局极小。
引用
@article{arxiv.1904.03626,
title = {On The Power of Curriculum Learning in Training Deep Networks},
author = {Guy Hacohen and Daphna Weinshall},
journal= {arXiv preprint arXiv:1904.03626},
year = {2020}
}
备注
In proceedings, ICML 2019