中文

关于超网络的模块化

机器学习 2020-11-03 v2 机器学习

摘要

在将输入 II 映射为函数 hI:XRh_I:\mathcal{X}\to \mathbb{R} 的学习背景下,比较两种替代方法:(i) 基于嵌入的方法,学习一个固定函数,其中 II 被编码为条件信号 e(I)e(I),所学函数形如 hI(x)=q(x,e(I))h_I(x) = q(x,e(I));(ii) 超网络,其中函数 hI(x)=g(x;θI)h_I(x) = g(x;\theta_I) 的权重 θI\theta_I 由超网络 ff 给出为 θI=f(I)\theta_I=f(I)。本文中,我们将模块化性质定义为对每个输入实例 II 有效学习不同函数的能力。为此,我们采用该性质的表达能力视角,推广 Devore 等人 1996 的理论,并通过消除对逼近方法鲁棒性的要求,给出神经网络作为函数逼近器的复杂度(可训练参数数量)下界。我们的结果随后用于比较 qqgg 的复杂度,表明在特定条件下并令函数 eeff 任意大时,gg 可比 qq 小数个数量级。这阐明了超网络相较基于嵌入方法的模块化。此外,我们展示对于结构化目标函数,超网络中可训练参数总数比标准神经网络与嵌入方法的可训练参数数量小数个数量级。

关键词

引用

@article{arxiv.2002.10006,
  title  = {On the Modularity of Hypernetworks},
  author = {Tomer Galanti and Lior Wolf},
  journal= {arXiv preprint arXiv:2002.10006},
  year   = {2020}
}

备注

Accepted to Advances in Neural Information Processing Systems (NeurIPS) 2020