中文

带延迟投影的大模型快速训练方法

机器学习 2024-11-26 v1 机器学习

摘要

经典核机器模型在大数据集和大模型规模方面一直面临显著挑战——这一因素驱动了神经网络的成功。在本文中,我们提出了一种新的方法,用于构建能够高效扩展至大数据规模和大模型规模的核机器。我们的算法引入了延迟投影到预条件随机梯度下降(PSGD),使得可以训练远超以往可行范围的更大模型,推动了基于核方法的学习实用极限。我们在多个数据集上验证了该算法(EigenPro4),展示了相较于现有方法在训练速度上实现大幅提升,同时保持与或优于现有方法的分类准确率。

关键词

引用

@article{arxiv.2411.16658,
  title  = {Fast training of large kernel models with delayed projections},
  author = {Amirhesam Abedsoltan and Siyuan Ma and Parthe Pandit and Mikhail Belkin},
  journal= {arXiv preprint arXiv:2411.16658},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2302.02605