揭示语言模型的参数知识:归因方法的统一框架
计算与语言
2024-04-30 v1 人工智能
摘要
语言模型(LMs)从其训练过程中获取参数知识,并将其嵌入在权重中。然而,LMs 日益增强的可扩展性给理解模型内部工作机制带来了巨大挑战,也使得在不付出高昂重训练代价的情况下更新或纠正这些嵌入的知识变得更加困难。这凸显了揭示确切存储了什么知识及其与特定模型组件之间关联的重要性。实例归因(IA)和神经元归因(NA)提供了对这种训练所获知识的洞察,但尚未对它们进行系统性比较。我们的研究引入了一个新颖的评估框架,以量化和比较 IA 和 NA 所揭示的知识。为了对齐这些方法的结果,我们引入了归因方法 NA-Instances(将 NA 应用于检索有影响力的训练实例)和 IA-Neurons(用于发现由 IA 发现的有影响力实例的重要神经元)。我们进一步提出了一系列全面的忠实性测试,以评估这两种方法提供的解释的全面性和充分性。通过广泛的实验和分析,我们证明,与 IA 相比,NA 通常能揭示关于 LM 参数知识的更多样化和全面的信息。尽管如此,IA 提供了关于 LM 参数知识的独特且有价值的洞察,而这些是 NA 未能揭示的。我们的发现进一步表明,结合 IA 和 NA 的多样化发现具有协同方法的潜力,可实现对 LM 参数知识的更全面理解。
引用
@article{arxiv.2404.18655,
title = {Revealing the Parametric Knowledge of Language Models: A Unified Framework for Attribution Methods},
author = {Haeun Yu and Pepa Atanasova and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2404.18655},
year = {2024}
}
备注
14 pages, 6 figures