中文

ReLU模型中的表示学习与恢复

机器学习 2018-03-13 v1 信息论 机器学习 math.IT

摘要

修正线性单元(ReLU)已成为人工神经网络首选的激活函数。本文考虑两个基本学习问题,假设底层数据遵循基于 ReLU 网络(带 ReLU 激活的神经网络)的生成模型。作为一项主要为理论的研究,我们限于单层网络。我们研究的第一个问题对应于存在非线性(由 ReLU 函数建模)时的字典学习。给定一组观测向量 yiRd,i=1,2,,n\mathbf{y}^i \in \mathbb{R}^d, i =1, 2, \dots , n,我们旨在模型 yi=ReLU(Aci+b)\mathbf{y}^i = \mathrm{ReLU}(A\mathbf{c}^i +\mathbf{b}) 下恢复 d×kd\times k 矩阵 AA 与潜向量 {ci}Rk\{\mathbf{c}^i\} \subset \mathbb{R}^k,其中 bRd\mathbf{b}\in \mathbb{R}^d 为随机偏置。我们表明在 b\mathbf{b} 概率分布的一定条件下,可在 O(d)O(d) 误差(Frobenius 范数)内恢复 AA 的列空间。我们考虑的第二个问题是在存在离群点即大而稀疏噪声时的信号鲁棒恢复。此设定下我们有兴趣从其形式为 v=ReLU(Ac)+e+w\mathbf{v} = \mathrm{ReLU}(A\mathbf{c}) + \mathbf{e}+\mathbf{w} 的含噪非线性 sketches 恢复潜向量 c\mathbf{c},其中 eRd\mathbf{e} \in \mathbb{R}^d 表示稀疏度为 ss 的离群点,wRd\mathbf{w} \in \mathbb{R}^d 表示稠密但小的噪声。此方向工作最近已被研究(Soltanolkotabi, 2017)但无离群点。对此问题,我们表明当 AA 为随机高斯矩阵时,广义 LASSO 算法能在 2\ell_2 误差 O((k+s)logdd)O(\sqrt{\frac{(k+s)\log d}{d}}) 内恢复信号 cRk\mathbf{c} \in \mathbb{R}^k

关键词

引用

@article{arxiv.1803.04304,
  title  = {Representation Learning and Recovery in the ReLU Model},
  author = {Arya Mazumdar and Ankit Singh Rawat},
  journal= {arXiv preprint arXiv:1803.04304},
  year   = {2018}
}