中文

学习高次奇偶校验函数:初始化的关键作用

机器学习 2025-03-06 v3

摘要

奇偶校验函数已成为评估学习算法的标准基准。近期研究表明,由梯度下降训练的常规神经网络可以在均匀输入上高效学习常数 k 的 k 次奇偶校验函数,但当 k 和 d−k 随 d 增长时(d 为环境维度)则无法做到。然而,k=d−O_d(1)(几乎完全奇偶校验)的情形——包括 d 次奇偶校验(完全奇偶校验)——至今尚未得到解决。本文表明,对于常规神经网络上的梯度下降,可学习性取决于初始权重分布。一方面,离散 Rademacher 初始化能够高效学习几乎完全奇偶校验,另一方面,其具有足够大常数标准差 σ 的高斯扰动则会阻碍学习。对于几乎完全奇偶校验的正结果被证明在 σ=O(d^{−1}) 的范围内仍然成立,这指向了关于更尖锐阈值现象的问题。与统计查询(SQ)学习不同——其中像完全奇偶校验这样的单例函数类可以平凡地学习——我们的负结果适用于固定函数,并依赖于一个初始梯度对齐度量,该度量对神经网络学习可能具有更广泛的相关性。

关键词

引用

@article{arxiv.2412.04910,
  title  = {Learning High-Degree Parities: The Crucial Role of the Initialization},
  author = {Emmanuel Abbe and Elisabetta Cornacchia and Jan Hązła and Donald Kougang-Yombi},
  journal= {arXiv preprint arXiv:2412.04910},
  year   = {2025}
}