基于训练-验证集划分的神经架构搜索泛化保证
机器学习
2022-03-04 v3 机器学习
摘要
神经架构搜索(NAS)是一种自动设计高性能深度学习优化架构的流行方法。在该方法中,通常采用双层优化:在训练数据上优化模型权重(内层问题),在验证数据上优化各种超参数(如架构配置,外层问题)。本文探讨了此类带训练-验证划分问题的统计特性。实践中,内层问题常呈过参数化且易达到零损失。因此,先验地看,仅基于训练损失似乎无法区分正确的超参数,这促使我们更好地理解训练-验证划分的作用。为此,本文建立了如下结果。(1)我们表明验证损失的精细性质(如风险和超梯度)可指示真实测试损失的性质。这揭示外层问题有助于选择最具泛化能力的模型,并以近最小的验证样本量防止过拟合。该结论针对与可微方案相关的连续搜索空间建立。我们还从训练与验证分布失配的角度拓展至迁移学习。(2)我们建立了 NAS 问题的泛化界,重点考察激活函数搜索问题。当用梯度下降优化时,我们表明即便所有架构都能完美拟合训练数据达到零误差,训练-验证过程仍能返回最优的(模型,架构)对。(3)最后,我们阐明了 NAS、多核学习与低秩矩阵学习之间的联系。后者带来新见解:外层问题的解可通过高效谱方法精确学习,以达到近最小风险。
引用
@article{arxiv.2104.14132,
title = {Generalization Guarantees for Neural Architecture Search with Train-Validation Split},
author = {Samet Oymak and Mingchen Li and Mahdi Soltanolkotabi},
journal= {arXiv preprint arXiv:2104.14132},
year = {2022}
}
备注
ICML 2021