权重修补:面向大语言模型的源级机制局部化
人工智能
2026-04-16 v1
摘要
机制可解释性旨在将模型行为局部化到内部组件中,这些组件因果地实现了该行为。先前的工作推进了激活空间局部化和因果追踪,但在激活空间中看起来重要的模块可能仅仅是聚合或放大上游信号,而非编码目标能力。为解决这一差距,我们提出了权重修补(Weight Patching),这是一种用于相同架构模型中进行源导向分析的参数空间干预方法,这些模型在特定输入下对目标能力的表达强度不同。给定基础模型和一种行为特化的模型,权重修补在固定输入下将特化模型中选定模块的权重替换到基础模型中。我们在指令遵循任务上实现了该方法,并引入一种以向量锚作为行为界面接口的框架,该框架提供了一种用于判断在开放式生成中是否已形成或恢复任务相关控制状态的共享内部标准。在此框架下,分析揭示了从浅层候选源侧承载器到聚合和路由模块,再到下游执行电路的层级结构。恢复的组件得分还可指导机制感知的模型合并,提高了在所评估的专家组合之间的选择性融合,并提供了额外的外部验证。
引用
@article{arxiv.2604.13694,
title = {Weight Patching: Toward Source-Level Mechanistic Localization in LLMs},
author = {Chenghao Sun and Chengsheng Zhang and Guanzheng Qin and Rui Dai and Xinmei Tian},
journal= {arXiv preprint arXiv:2604.13694},
year = {2026}
}
备注
36 pages. Submitted to IEEE for possible publication