大语言模型能否预测随机梯度下降的收敛?
机器学习
2024-08-06 v1 人工智能
机器学习
摘要
大语言模型以其在广泛任务上的惊人性能而闻名。其中一个令人惊讶的性能示例是,最近发现到的大语言模型理解满足马尔可夫性质的动力系统基本原理的能力。在本文中,我们进一步探索了这一方向,通过研究随机梯度下降在凸和非凸优化中的动力学。通过利用SGD与马尔可夫链之间的理论联系,我们展示了大语言模型在预测SGD对以前未见过的起始点的收敛局部极小值方面实现了惊人的零样本性能。在更一般的层面上,我们询问了是否可以使用大语言模型为在实际中使用的更大深度学习模型执行零样本随机试验的可能性。
引用
@article{arxiv.2408.01736,
title = {Can LLMs predict the convergence of Stochastic Gradient Descent?},
author = {Oussama Zekri and Abdelhakim Benechehab and Ievgen Redko},
journal= {arXiv preprint arXiv:2408.01736},
year = {2024}
}
备注
9 pages. Accepted to 1st ICML Workshop on In-Context Learning at ICML 2024