中文

通过梯度下降在对抗标签噪声下学习单个神经元

机器学习 2022-06-20 v1 数据结构与算法 统计理论 机器学习 统计理论

摘要

我们研究了在对抗性标签噪声下,关于 L22L_2^2 损失学习单个神经元(即对于单调激活函数 σ:RR\sigma:\mathbb{R}\mapsto\mathbb{R},形如 xσ(wx)\mathbf{x}\mapsto\sigma(\mathbf{w}\cdot\mathbf{x}) 的函数)的基本问题。具体来说,我们给定来自分布 DD(x,y)Rd×R(\mathbf{x}, y)\in\mathbb{R}^d \times \mathbb{R} 上的带标签样本,使得存在 wRd\mathbf{w}^\ast\in\mathbb{R}^d 满足 F(w)=ϵF(\mathbf{w}^\ast)=\epsilon,其中 F(w)=E(x,y)D[(σ(wx)y)2]F(\mathbf{w})=\mathbf{E}_{(\mathbf{x},y)\sim D}[(\sigma(\mathbf{w}\cdot \mathbf{x})-y)^2]。学习器的目标是输出一个假设向量 w\mathbf{w},使得以高概率满足 F(w)=CϵF(\mathbb{w})=C\, \epsilon,其中 C>1C>1 是一个通用常数。作为我们的主要贡献,我们为一大类分布(包括对数凹分布)和激活函数给出了高效的常数因子近似学习器。具体来说,对于各向同性对数凹分布类,我们得到以下重要推论:对于 Logistic 激活,我们获得了第一个多项式时间的常数因子近似(即使在高斯分布下)。我们的算法样本复杂度为 O~(d/ϵ)\widetilde{O}(d/\epsilon),这在多对数因子内是紧的。对于 ReLU 激活,我们给出了一个样本复杂度为 O~(d\polylog(1/ϵ))\tilde{O}(d\, \polylog(1/\epsilon)) 的高效算法。在我们工作之前,已知最佳的常数因子近似学习器的样本复杂度为 Ω~(d/ϵ)\tilde{\Omega}(d/\epsilon)。在这两种设置下,我们的算法都很简单,即对(正则化的)L22L_2^2 损失执行梯度下降。我们算法的正确性依赖于我们建立的新颖的结构性结果,这些结果表明底层非凸损失的(基本上所有)驻点都是近似最优的。

关键词

引用

@article{arxiv.2206.08918,
  title  = {Learning a Single Neuron with Adversarial Label Noise via Gradient Descent},
  author = {Ilias Diakonikolas and Vasilis Kontonis and Christos Tzamos and Nikos Zarifis},
  journal= {arXiv preprint arXiv:2206.08918},
  year   = {2022}
}