预训练中学习的提取结构使模型在微调事实后能够泛化
机器学习
2025-05-23 v3 计算与语言
摘要
预训练语言模型(LM)能够对其微调事实的含义进行泛化。例如,如果在"John Doe居住在东京"上进行微调,LM则能正确回答"约翰·多的城市人会说什么语言?",答案为"日语"。然而,关于这种泛化机制及其在预训练期间是如何学习的,目前仍知之�少。我们提出了提取结构作为描述语言模型中各组件(例如MLP或注意力头)如何协调以实现这种泛化的框架。该结构由存储训练事实作为权重变化的Informative组件组成,以及查询和处理存储信息以产生正确含义的上游和下游提取组件。我们假设,在遇到已知事实的含义时,提取结构将在预训练期间被学习。这导致两个预测:即数据排序效应,即只有在事实 precede 其含义时,提取结构才可被学习;以及权重移植效应,即提取结构可被移植以预测反事实含义。我们在OLMo-7b、Llama 3-8b、Gemma 2-9b和Qwen 2-7b模型中进行了实证研究。值得注意的是,我们的结果还表明,事实学习可以在早期和晚期层次上发生,这导致不同的泛化形式。
引用
@article{arxiv.2412.04614,
title = {Extractive Structures Learned in Pretraining Enable Generalization on Finetuned Facts},
author = {Jiahai Feng and Stuart Russell and Jacob Steinhardt},
journal= {arXiv preprint arXiv:2412.04614},
year = {2025}
}