利用影响函数研究大语言模型的泛化能力
机器学习
2023-08-08 v1 计算与语言
机器学习
摘要
当试图更好地洞察机器学习模型以理解和缓解相关风险时,一个潜在有价值的证据来源是:哪些训练样本对给定行为的贡献最大?影响函数旨在回答一个反事实问题:如果将给定的序列加入训练集,模型的参数(及其输出)会如何变化?尽管影响函数已为小型模型提供了见解,但由于计算逆海森-向量积(IHVP)的困难,它们难以扩展到大型语言模型(LLMs)。我们使用特征值修正的克罗内克因子近似曲率(EK-FAC)近似将影响函数扩展到参数多达520亿的LLMs。在我们的实验中,尽管IHVP计算速度快了数个数量级,EK-FAC仍达到了与传统影响函数估计器相近的精度。我们研究了两种降低候选训练序列梯度计算成本的算法技术:TF-IDF过滤和查询批处理。我们利用影响函数研究了LLMs的泛化模式,包括影响模式的稀疏性、随规模增加的抽象能力、数学与编程能力、跨语言泛化以及角色扮演行为。尽管存在许多看似复杂的泛化形式,我们发现了一种令人惊讶的局限:当关键短语的顺序被颠倒时,影响衰减至接近零。总体而言,影响函数为我们提供了一种研究LLMs泛化特性的强大新工具。
引用
@article{arxiv.2308.03296,
title = {Studying Large Language Model Generalization with Influence Functions},
author = {Roger Grosse and Juhan Bae and Cem Anil and Nelson Elhage and Alex Tamkin and Amirhossein Tajdini and Benoit Steiner and Dustin Li and Esin Durmus and Ethan Perez and Evan Hubinger and Kamilė Lukošiūtė and Karina Nguyen and Nicholas Joseph and Sam McCandlish and Jared Kaplan and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2308.03296},
year = {2023}
}
备注
119 pages, 47 figures, 22 tables