中文

基于梯度流的高斯多指标模型学习:时间复杂度与方向收敛

机器学习 2025-03-12 v2 神经与进化计算 代数几何

摘要

本文研究了使用相关损失在高维标准高斯数据上逼近多指标函数的神经网络模型的梯度流动力学。具体而言,我们考虑的多指标函数是神经元之和 f(x) ⁣= ⁣j=1k ⁣σ(vjTx)f^*(x) \!=\! \sum_{j=1}^k \! \sigma^*(v_j^T x),其中 v1,,vkv_1, \dots, v_k 为单位向量,且 σ\sigma^* 在其厄米展开中缺少第一和第二厄米多项式。已知对于单指标情况(k ⁣= ⁣1k\!=\!1),克服搜索阶段需要多项式时间复杂度。我们首次将这一结果推广到由任意方向向量刻画的多指标函数。搜索阶段之后,网络神经元是收敛到指标向量,还是陷入次优解,尚不清楚。当指标向量正交时,我们给出了不动点的完整刻画,并证明神经元收敛到最近的指标向量。因此,使用 n ⁣ ⁣klogkn \! \asymp \! k \log k 个神经元可确保梯度流在随机初始化下以高概率找到全体指标向量。当对所有 iji \neq jviTvj ⁣= ⁣β ⁣ ⁣0 v_i^T v_j \!=\! \beta \! \geq \! 0 时,我们证明了存在一个尖锐阈值 βc ⁣= ⁣c/(c+k)\beta_c \!=\! c/(c+k),在此阈值处计算指标向量平均值的不动点从鞍点转变为极小值点。数值模拟表明,使用相关损失和温和的过参数化足以在指标向量近似正交时学习所有指标向量,然而当指标向量间的点积超过某一阈值时,相关损失会失效。

关键词

引用

@article{arxiv.2411.08798,
  title  = {Learning Gaussian Multi-Index Models with Gradient Flow: Time Complexity and Directional Convergence},
  author = {Berfin Şimşek and Amire Bendjeddou and Daniel Hsu},
  journal= {arXiv preprint arXiv:2411.08798},
  year   = {2025}
}

备注

22 pages, to be presented at AISTATS 2025