复用卷积神经网络已训练层以缩短超参数调优时间
机器学习
2020-07-31 v2 分布式、并行与集群计算
机器学习
摘要
超参数调优是一项耗时的方法,尤其当神经网络架构本身作为该过程的一部分被决定时。例如在卷积神经网络(CNNs)中,可能需要决定隐藏(卷积)层的数量与特性。这意味着搜索过程涉及对所有这些候选网络架构的训练。本文描述一种复用不同训练间隐藏(卷积)层权重以缩短该过程的方案。其原理在于:若一组卷积层已训练用于解决某给定问题,则此次训练计算出的权重在向网络架构新增卷积层时可能仍具用处。该想法使用 CIFAR-10 数据集进行了测试,试验了多达 3 个卷积层与多达 3 个全连接层的不同 CNN 架构。实验比较了复用与不复用卷积层时的训练时间与验证损失。其证实该策略在减少训练时间的同时甚至提高了所得神经网络的准确率。这一发现开启了未来将该策略集成至现有 AutoML 方法中以缩减总搜索时间的可能性。
引用
@article{arxiv.2006.09083,
title = {Reusing Trained Layers of Convolutional Neural Networks to Shorten Hyperparameters Tuning Time},
author = {Roberto L. Castro and Diego Andrade and Basilio Fraguela},
journal= {arXiv preprint arXiv:2006.09083},
year = {2020}
}