重新审视梯度下降:一种用于改进学习的双权重方法
机器学习
2025-03-19 v2
摘要
我们提出了一种通过将每个神经元的权重向量分解为两个不同部分 和 的新框架,从而直接在神经元层面建模对比信息。传统的梯度下降在单个权重向量中同时存储正(目标)特征和负(非目标)特征信息,往往掩盖了细粒度的区分。相比之下,我们的方法分别维护目标和非目标特征的更新,最终形成单个有效权重 ,对噪声和类别不平衡更具鲁棒性。在回归(California Housing、Wine Quality)和分类(MNIST、Fashion-MNIST、CIFAR-10)任务上的实验结果表明,这种分解增强了泛化能力并抵抗过拟合,尤其是在训练数据稀疏或有噪声的情况下。关键的是,推理复杂度与标准 设置相同,提供了一种无需额外推理开销的改进学习实用方案。
引用
@article{arxiv.2503.11965,
title = {Revisiting Gradient Descent: A Dual-Weight Method for Improved Learning},
author = {Xi Wang},
journal= {arXiv preprint arXiv:2503.11965},
year = {2025}
}