中文

一种过参数化指数回归

机器学习 2023-03-30 v1 机器学习

摘要

过去几年中,大量研究聚焦于 ReLU 激活函数,旨在通过过参数化实现神经网络收敛。然而,大语言模型 (LLMs) 领域的最新进展引发了对指数激活函数(特别是在注意力机制中)使用的兴趣。从数学上,我们使用指数激活函数定义神经函数 F:Rd×m×RdRF: \mathbb{R}^{d \times m} \times \mathbb{R}^d \rightarrow \mathbb{R}。给定一组带标签的数据点 {(x1,y1),(x2,y2),,(xn,yn)}Rd×R\{(x_1, y_1), (x_2, y_2), \dots, (x_n, y_n)\} \subset \mathbb{R}^d \times \mathbb{R},其中 nn 表示数据数量。此处 F(W(t),x)F(W(t),x) 可表示为 F(W(t),x):=r=1marexp(wr,x)F(W(t),x) := \sum_{r=1}^m a_r \exp(\langle w_r, x \rangle),其中 mm 表示神经元数量,wr(t)w_r(t) 为时刻 tt 的权重。文献中标准设定为 ara_r 是固定权重且在训练过程中从不改变。我们以随机高斯分布初始化权重 W(0)Rd×mW(0) \in \mathbb{R}^{d \times m},使得 wr(0)N(0,Id)w_r(0) \sim \mathcal{N}(0, I_d),并对每个 r[m]r \in [m] 从随机符号分布初始化 ara_r。使用梯度下降算法,我们可以找到一个权重 W(T)W(T) 使得 F(W(T),X)y2ϵ\| F(W(T), X) - y \|_2 \leq \epsilon 以概率 1δ1-\delta 成立,其中 ϵ(0,0.1)\epsilon \in (0,0.1)m=Ω(n2+o(1)log(n/δ))m = \Omega(n^{2+o(1)}\log(n/\delta))。为优化过参数化界 mm,我们采用了先前研究 [Song and Yang arXiv 2019, Munteanu, Omlor, Song and Woodruff ICML 2022] 中的若干紧分析技术。

关键词

引用

@article{arxiv.2303.16504,
  title  = {An Over-parameterized Exponential Regression},
  author = {Yeqi Gao and Sridhar Mahadevan and Zhao Song},
  journal= {arXiv preprint arXiv:2303.16504},
  year   = {2023}
}