中文

重新审视梯度下降:一种用于改进学习的双权重方法

机器学习 2025-03-19 v2

摘要

我们提出了一种通过将每个神经元的权重向量分解为两个不同部分 W1W_1W2W_2 的新框架,从而直接在神经元层面建模对比信息。传统的梯度下降在单个权重向量中同时存储正(目标)特征和负(非目标)特征信息,往往掩盖了细粒度的区分。相比之下,我们的方法分别维护目标和非目标特征的更新,最终形成单个有效权重 W=W1W2W = W_1 - W_2,对噪声和类别不平衡更具鲁棒性。在回归(California Housing、Wine Quality)和分类(MNIST、Fashion-MNIST、CIFAR-10)任务上的实验结果表明,这种分解增强了泛化能力并抵抗过拟合,尤其是在训练数据稀疏或有噪声的情况下。关键的是,推理复杂度与标准 WX+biasWX + \text{bias} 设置相同,提供了一种无需额外推理开销的改进学习实用方案。

关键词

引用

@article{arxiv.2503.11965,
  title  = {Revisiting Gradient Descent: A Dual-Weight Method for Improved Learning},
  author = {Xi Wang},
  journal= {arXiv preprint arXiv:2503.11965},
  year   = {2025}
}