中文

动态权重嫁接:定位 Transformer 中微调所学的事实性知识

机器学习 2026-03-03 v3

摘要

当一个大语言模型在微调过程中习得一条新事实时(例如新上映的电影、新当选的教皇等),这些信息究竟存储在哪里?是实体在处理过程中即时被充实以关系信息,还是模型仅在预测前按需即时回忆相关信息?抑或上述机制兼而有之,即模型同时实现了多种冗余启发式策略?现有的定位方法(如激活补丁)并不适用于此类分析,因为它们通常会替换残差流中的部分内容,从而覆盖先前信息。为填补这一可解释性方面的空白,我们提出了一种名为动态权重嫁接的分析技术,它能够选择性地将微调模型中的部分权重嫁接到预训练模型上。利用该技术,我们揭示了检索微调所学关系信息的两条独立通路:1) 在处理与实体对应的词元(例如 "Zendaya co-starred with Timoth\'ee Chalamet" 中的 "Zendaya")时,"充实"残差流中的关系信息;2) 在生成目标事实之前的最后一个词元位置,"回忆"该信息。在某些情形下,模型需要同时借助这两条通路才能正确生成微调所学事实;而在另一些情形下,仅凭"充实"通路或"回忆"通路之一即可。我们将"回忆"通路定位到具体的模型组件——发现"回忆"既通过任务特定的注意力机制实现,也通过预测前最后几层前馈网络中的实体特定抽取步骤实现。通过聚焦于模型组件与参数而非仅关注激活,我们得以深入理解微调所学知识在生成过程中被检索的机制。

关键词

引用

@article{arxiv.2506.20746,
  title  = {Dynamic Weight Grafting: Localizing Finetuned Factual Knowledge in Transformers},
  author = {Todd Nief and David Reber and Sean Richardson and Ari Holtzman},
  journal= {arXiv preprint arXiv:2506.20746},
  year   = {2026}
}