中文

当你的离散优化问题规模如同神经网络般巨大时该怎么办?

机器学习 2024-02-19 v1

摘要

很多时候,使用神经网络的机器学习应用涉及解决离散优化问题,例如在剪枝、基于参数隔离的持续学习以及二值网络训练中。然而,这些离散问题本质上是组合的,且不适用于基于梯度的优化。此外,离散设置中使用的经典方法难以扩展到大型神经网络,迫使科学家和经验主义者依赖替代方法。在这些方法中,可以利用两种主要的自上而下信息来源来引导模型获得良好解:(1) 从解集外的点外推梯度信息;(2) 比较有效解子集成员之间的评估结果。我们将延续路径(CP)方法视为仅使用前者,将蒙特卡洛(MC)方法视为代表后者,同时注意到一些混合方法结合了两者。本工作的主要目标是比较这两种方法。为此,我们首先概述这两类方法,同时分析讨论它们的一些缺点。然后在实验部分,我们比较它们的性能,从允许更细粒度控制问题变量的小型微观世界实验开始,逐渐过渡到更大的问题,包括神经网络回归和用于图像分类的神经网络剪枝,在此我们还与基于幅值的剪枝进行了比较。

关键词

引用

@article{arxiv.2402.10339,
  title  = {What to Do When Your Discrete Optimization Is the Size of a Neural Network?},
  author = {Hugo Silva and Martha White},
  journal= {arXiv preprint arXiv:2402.10339},
  year   = {2024}
}

备注

Submitted to JMLR