中文

双过程学习:通过权重遗忘控制上下文内策略与权重内策略的使用

计算与语言 2025-03-04 v3 机器学习

摘要

语言模型具有执行上下文内学习(ICL)的能力,使其能够根据上下文灵活调整行为。这与权重内学习(IWL)形成对比,后者中记忆的信息在反复观察数据后被编码到模型参数中。理想的模型应能灵活部署这两种能力。尽管语言模型具有明显的上下文学习能力,但已知它们在面对未见或罕见词元时会遇到困难(Land & Bartolo, 2024)。因此,我们研究结构上下文内学习\textbf{结构上下文内学习},我们将其定义为模型对任意新颖词元执行上下文内学习的能力——之所以如此称呼,是因为模型必须基于例如句子结构或任务结构进行泛化,而不是基于词元嵌入中编码的内容。我们使用玩具模型、掩码语言模型和自回归语言模型,在合成和自然主义任务上研究结构上下文内算法。我们发现,结构ICL在语言模型预训练早期出现后迅速消失。虽然已有研究表明ICL可能在训练过程中减弱(Singh et al., 2023),但我们发现先前的工作未考虑结构ICL。基于Chen等人(2024)的主动遗忘方法,我们引入了可以调节对结构ICL和IWL偏好的预训练和微调方法。重要的是,这使我们能够诱导出一种双过程策略\textit{双过程策略},其中上下文内和权重内解决方案共存于单个模型中。

关键词

引用

@article{arxiv.2406.00053,
  title  = {Dual Process Learning: Controlling Use of In-Context vs. In-Weights Strategies with Weight Forgetting},
  author = {Suraj Anand and Michael A. Lepori and Jack Merullo and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2406.00053},
  year   = {2025}
}

备注

10 pages, 6 figures