中文

重新审视梯度的信息量

机器学习 2025-05-30 v1

摘要

在过去十年中,基于梯度的深度学习彻底改变了若干应用。然而,这种快速发展凸显出了对其局限性进行更深入理论理解的需求。研究表明,在许多实际学习任务中,梯度包含的信息极其有限,以至于基于梯度的方法需要极大量的迭代才能取得成功。梯度的信息量通常通过其相对于从假设类中随机选取目标函数的方差来衡量。我们使用这一框架,并给出了关于该方差的一般界限,该界限以与目标函数类的成对独立性以及输入分布的碰撞熵相关的参数表示。我们的界限规模为 O~(ε+e12Ec) \tilde{\mathcal{O}}(\varepsilon+e^{-\frac{1}{2}\mathcal{E}_c}) ,其中 O~ \tilde{\mathcal{O}} 隐藏了与学习模型和损失函数的正则性相关的因子,ε \varepsilon 衡量目标函数类的成对独立性,Ec\mathcal{E}_c 是输入分布的碰撞熵。为了证明我们界限的实际效用,我们将其应用于带误差学习(LWE)映射类和高频函数。除了理论分析外,我们还进行了实验,以更好地理解近期基于深度学习的 LWE 攻击的本质。

关键词

引用

@article{arxiv.2505.22158,
  title  = {The informativeness of the gradient revisited},
  author = {Rustem Takhanov},
  journal= {arXiv preprint arXiv:2505.22158},
  year   = {2025}
}