中文

关于可微学习相对于 PAC 学习与 SQ 学习的能力

机器学习 2022-02-08 v2 机器学习

摘要

我们研究了在可微模型或神经网络的总体损失上进行小批量随机梯度下降(SGD)学习,以及在经验损失上进行批量梯度下降(GD)学习的能力,并探讨了哪些学习问题可以使用这些范式来学习。我们证明,SGD 和 GD 总是可以模拟统计查询(SQ)学习,但它们超越 SQ 学习的能力取决于梯度计算的精度 ρ\rho 相对于小批量大小 bb(对于 SGD)和样本大小 mm(对于 GD)的关系。当相对于小批量大小的精度足够高,即 bρb \rho 足够小时,SGD 可以超越 SQ 学习并模拟任何基于样本的学习算法,因此其学习能力等价于 PAC 学习;这将先前针对 b=1b=1 取得的结果进行了推广。类似地,当相对于样本大小 mm 的精度足够高时,GD 也可以模拟任何基于 mm 个样本的基于样本的学习算法。特别是,当具有多项式量级的比特精度(即 ρ\rho 指数级小时),无论小批量大小如何,SGD 和 GD 都可以模拟 PAC 学习。另一方面,当 bρ2b \rho^2 足够大时,SGD 的能力等价于 SQ 学习。

关键词

引用

@article{arxiv.2108.04190,
  title  = {On the Power of Differentiable Learning versus PAC and SQ Learning},
  author = {Emmanuel Abbe and Pritish Kamath and Eran Malach and Colin Sandon and Nathan Srebro},
  journal= {arXiv preprint arXiv:2108.04190},
  year   = {2022}
}