可扩展且能泛化的习得优化器
机器学习
2017-09-11 v4 神经与进化计算
机器学习
摘要
学会学习已成为实现人工智能的一个重要方向。其应用的两个主要障碍是无法扩展到更大的问题以及泛化到新任务的能力有限。我们提出了一种习得梯度下降优化器,它能很好地泛化到新任务,并且显著降低了内存与计算开销。我们通过引入一种新颖的分层 RNN 架构来实现这一点,该架构具有极小的每参数开销,并增强了反映优化任务已知结构的额外架构特征。我们还开发了一个由小型、多样化优化任务组成的元训练集成,以捕捉损失景观的共同性质。该优化器在此语料库中的问题上学习以超越 RMSProp/ADAM。更重要的是,尽管其元训练集中未出现任何神经网络,当应用于小型卷积神经网络时,其表现相当或更好。最后,它泛化到在 ImageNet 数据集上训练 Inception V3 与 ResNet V2 架构数千步,这些优化问题的规模与其训练时所遇问题截然不同。我们发布了该元训练算法的开源实现。
引用
@article{arxiv.1703.04813,
title = {Learned Optimizers that Scale and Generalize},
author = {Olga Wichrowska and Niru Maheswaranathan and Matthew W. Hoffman and Sergio Gomez Colmenarejo and Misha Denil and Nando de Freitas and Jascha Sohl-Dickstein},
journal= {arXiv preprint arXiv:1703.04813},
year = {2017}
}
备注
Final ICML paper after reviewer suggestions