通过网络变换进行高效架构搜索
机器学习
2017-11-22 v2 人工智能
摘要
自动设计深度神经网络架构的技术(如基于强化学习的方法)最近显示出令人鼓舞的结果。然而,它们的成功依赖于巨大的计算资源(例如数百个 GPU),使其难以被广泛使用。一个明显的局限性是,它们在探索架构空间期间仍从头开始设计和训练每个网络,效率极低。在本文中,我们提出了一个面向高效架构搜索的新框架,该框架基于当前网络探索架构空间并复用其权重。我们采用强化学习代理作为元控制器,其动作是通过保函变换增加网络深度或层宽度。因此,先前验证过的网络可以被复用以进行进一步探索,从而节省大量计算成本。我们将该方法应用于在受限计算资源(5 个 GPU)下,在图像基准数据集(CIFAR-10、SVHN)上探索普通卷积神经网络(无跳跃连接、分支等)的架构空间。我们的方法能够设计出极具竞争力的网络,其性能优于使用相同设计方案的其他现有网络。在 CIFAR-10 上,我们的无跳跃连接模型实现了 4.23\% 的测试错误率,超越了绝大多数现代架构并接近 DenseNet。此外,通过将我们的方法应用于探索 DenseNet 架构空间,我们能够以 fewer 参数实现更准确的网络。
引用
@article{arxiv.1707.04873,
title = {Efficient Architecture Search by Network Transformation},
author = {Han Cai and Tianyao Chen and Weinan Zhang and Yong Yu and Jun Wang},
journal= {arXiv preprint arXiv:1707.04873},
year = {2017}
}
备注
The Thirty-Second AAAI Conference on Artificial Intelligence (AAAI-18). We change the title from "Reinforcement Learning for Architecture Search by Network Transformation" to "Efficient Architecture Search by Network Transformation"