当表达能力遇上可训练性:少于 $n$ 个神经元亦可奏效
机器学习
2022-10-24 v1
摘要
现代神经网络通常很宽,导致巨大的内存与计算开销。因此,训练更窄的网络具有重大意义。然而,训练窄神经网络仍是一项具有挑战性的任务。我们提出两个理论问题:窄网络能否具备与宽网络一样强的表达能力?如果可以,损失函数是否呈现良性的优化景观?在本工作中,对于激活函数光滑、神经元数少于 (样本量)的 1-隐藏层网络,我们对这两个问题给出了部分肯定的回答。首先,我们证明只要宽度 (其中 为输入维度),其表达能力就很强,即至少存在一个训练损失为零的全局极小点。其次,我们识别出一个无局部极小点或鞍点的良好局部区域。不过,尚不清楚梯度下降能否停留在该良好区域内。第三,我们考虑一种约束优化形式,其可行域为该良好局部区域,并证明每个 KKT 点都是近全局极小点。预期投影梯度法在温和技术条件下收敛到 KKT 点,但严格的收敛分析留待未来工作。充分的数值结果表明,在该约束形式上的投影梯度法在训练窄神经网络时显著优于 SGD。
引用
@article{arxiv.2210.12001,
title = {When Expressivity Meets Trainability: Fewer than $n$ Neurons Can Work},
author = {Jiawei Zhang and Yushun Zhang and Mingyi Hong and Ruoyu Sun and Zhi-Quan Luo},
journal= {arXiv preprint arXiv:2210.12001},
year = {2022}
}
备注
39 Pages