DrMAD:蒸馏反向模式自动微分以优化深度神经网络超参数
机器学习
2016-04-07 v5 神经与进化计算
摘要
深度神经网络的性能众所周知对其超参数设置敏感。反向模式自动微分的最新进展使得利用梯度优化超参数成为可能。计算这些梯度的标准方法涉及计算的前向与反向传递。然而,反向传递通常需要消耗难以承受的内存来存储所有中间变量,以精确逆转前向训练过程。本工作中我们提出一种简单而有效的方法DrMAD,将前向传递的知识蒸馏至一条捷径路径,通过它我们近似逆转训练轨迹。在多个图像基准数据集上的实验表明,与优化超参数的当前最佳方法相比,DrMAD至少快45倍且内存消耗减少100倍,而其有效性妥协极小。据我们所知,DrMAD是首个使自动调优深度神经网络数千超参数成为实用的研究尝试。代码可从 https://github.com/bigaidream-projects/drmad 下载。
引用
@article{arxiv.1601.00917,
title = {DrMAD: Distilling Reverse-Mode Automatic Differentiation for Optimizing Hyperparameters of Deep Neural Networks},
author = {Jie Fu and Hongyin Luo and Jiashi Feng and Kian Hsiang Low and Tat-Seng Chua},
journal= {arXiv preprint arXiv:1601.00917},
year = {2016}
}
备注
International Joint Conference on Artificial Intelligence, IJCAI, 2016