老地图导航:静态机械局部化在 LLM 后训练中的陷阱
计算与语言
2026-05-08 v1
摘要
“定位-更新”范式已成为大型语言模型(LLM)后训练中 predominant 的方法,通过机械可解释性识别关键组件以实现针对性参数更新。然而,这一范式建立在一个根本且未经验证的假设之上:当前从静态参数中派生的机制能否可靠地指导未来的动态参数更新?为此,我们系统跟踪 Transformer 电路在监督微调(SFT)过程中结构演化的过程,揭示了任务机制的底层动力学。我们引入了三个新指标——电路距离、电路稳定性和电路冲突——来分析跨三个维度(神经迁移、语义稳定性和跨任务干扰)的电路演化。我们的实证结果表明,电路在参数更新期间本质上表现出“自由演化”。因此,来自当前状态的静态机制不可避免地存在时间延迟,对于指导未来状态而言是根本不足的。此外,通过解构现有方法中“有效性幻觉”的构建,本工作强调了机械局部化中“前瞻”需求的必要性,并提出了一种用于未来研究的预测框架。
引用
@article{arxiv.2605.06076,
title = {Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training},
author = {Hang Chen and Jiaying Zhu and Hongyang Chen and Hongxu Liu and Xinyu Yang and Wenya Wang},
journal= {arXiv preprint arXiv:2605.06076},
year = {2026}
}
备注
26 pages