梯度下降能否模拟提示?
计算与语言
2025-06-27 v1 机器学习
摘要
将新信息整合到语言模型(LM)中有两种主要方式:更改其提示或更改其参数(例如通过微调)。参数更新不会为模型更改带来长期存储成本。然而,对于许多模型更新,提示更为有效:经过提示的模型能够从单个样本中稳健地泛化,并做出在标准微调下不会发生的逻辑推断。能否对模型进行修改,使得微调能够模拟提示?本文描述了一种对LM进行元训练的方法,使得梯度更新能够模拟以新信息为条件的效果。我们的方法使用了基于梯度的元学习工具,但将LM自身的提示预测作为目标,消除了对真实标签的需求。随后的梯度下降训练恢复了部分(偶尔是全部)提示模型的性能——在“反转诅咒”任务上显示出改进,并在单次梯度更新后回答关于文本段落的问题。这些结果表明,通过适当的初始化,梯度下降可以表现出惊人的表达能力。我们的结果为长上下文建模提出了新途径,并提供了对基于梯度的学习泛化能力的洞察。
引用
@article{arxiv.2506.20989,
title = {Can Gradient Descent Simulate Prompting?},
author = {Eric Zhang and Leshem Choshen and Jacob Andreas},
journal= {arXiv preprint arXiv:2506.20989},
year = {2025}
}
备注
14 pages, 2 figures