中文

学习映射 $\mathbf{x}\mapsto \sum_{i=1}^d x_i^2$:大海捞针的代价

机器学习 2020-05-19 v2 数值分析 数值分析 机器学习

摘要

利用机器学习逼近映射 xi=1dxi2\mathbf{x}\mapsto\sum_{i=1}^d x_i^2(其中 xi[1,1]x_i\in[-1,1])的任务看似平凡。在已知该函数可分离结构的情况下,人们可设计稀疏网络以非常精确甚至精确地表示该函数。当此类结构信息不可得、且只能使用稠密神经网络时,在稠密网络中寻找嵌入的稀疏网络的优化过程,类似于用给定数量的函数样本在大海捞针。我们证明,寻找针的代价(以样本复杂度衡量)与该函数的Barron范数直接相关。虽然训练稀疏网络仅需少量样本,但用相同样本数训练的稠密网络表现出较大的测试损失与泛化差距。为控制泛化差距的大小,我们发现显式正则化的使用随 dd 增大而愈发重要。数值观测到的带显式正则化的样本复杂度随 O(d2.5)\mathcal{O}(d^{2.5}) 缩放,实则优于理论上预测的随 O(d4)\mathcal{O}(d^{4}) 缩放的样本复杂度。在无显式正则化(亦称隐式正则化)时,数值观测到的样本复杂度显著更高,接近 O(d4.5)\mathcal{O}(d^{4.5})

关键词

引用

@article{arxiv.2002.10561,
  title  = {Learning the mapping $\mathbf{x}\mapsto \sum_{i=1}^d x_i^2$: the cost of finding the needle in a haystack},
  author = {Jiefu Zhang and Leonardo Zepeda-Núñez and Yuan Yao and Lin Lin},
  journal= {arXiv preprint arXiv:2002.10561},
  year   = {2020}
}