中文

平滑损失地形增强 SGD 信号:学习单指标模型的最优样本复杂度

机器学习 2023-05-19 v1 信息论 math.IT 机器学习

摘要

我们关注于在 dd 维各向同性高斯分布下学习单指标模型 σ(wx)\sigma(w^\star \cdot x) 的任务。先前工作表明,学习 ww^\star 的样本复杂度由链接函数 σ\sigma 的信息指数 kk^\star 决定,其定义为 σ\sigma 的第一个非零 Hermite 系数的指标。Ben Arous 等人(2021)证明 ndk1n \gtrsim d^{k^\star-1} 个样本足以学习 ww^\star,且这对在线 SGD 是紧的。然而,基于梯度方法的 CSQ 下界仅表明 ndk/2n \gtrsim d^{k^\star/2} 个样本是必要的。在本工作中,我们通过在平滑损失上的在线 SGD 以 ndk/2n \gtrsim d^{k^\star/2} 个样本学习 ww^\star,弥合了上下界之间的差距。我们还建立了与张量 PCA 统计分析以及小批量 SGD 在经验损失上隐式正则化效应的联系。

关键词

引用

@article{arxiv.2305.10633,
  title  = {Smoothing the Landscape Boosts the Signal for SGD: Optimal Sample Complexity for Learning Single Index Models},
  author = {Alex Damian and Eshaan Nichani and Rong Ge and Jason D. Lee},
  journal= {arXiv preprint arXiv:2305.10633},
  year   = {2023}
}