中文

扰动探测:一种用于对齐大语言模型中FFN行为回路的每提示双次传递诊断方法

计算与语言 2026-05-01 v1 机器学习

摘要

扰动探测利用每个提示两次前向传递且无需反向传播,为大型语言模型中的前馈网络神经元生成任务特定的因果假设,随后进行一次摊销至所有已识别神经元的约150次传递的干预扫描。在八个行为回路、13个模型和四个架构家族中,我们识别出两种组织大语言模型行为的回路结构。当基于人类反馈的强化学习(RLHF)抑制预训练倾向时,会出现对立回路。在安全拒绝中,约50个神经元(占所有神经元的0.014%)控制着拒绝模板;在520个AdvBench提示上消融它们会改变80%的响应格式,同时产生接近于零的有害合规性(520例中仅3例,且均带有免责声明)。对于通过注意力分布的预训练行为,则出现路由回路。对于语言选择,在满足三个观察条件(双语训练、FFN到跳跃信号比在0.3到1.1之间以及线性可表示性)的19个测试模型中的3个上,残差流方向注入在580个基准提示的99.1%上将英语输出切换为中文。相同的干预在其他16个模型以及数学、代码和事实回路中失败,这定义了方向操控的局限性。从相同的两次前向传递中计算出的FFN到跳跃信号比,可以区分这两种结构并预测合适的干预方式。回路拓扑因架构而异,从Qwen的集中式FFN瓶颈到Gemma的归一化屏蔽回路。在Qwen3.5-2B中,消融20个神经元消除了多轮谄媚式屈服,而放大10个相关神经元则将200个TruthfulQA提示上的事实修正率从52%提高到88%。这些结果表明,扰动探测为RLHF组织的行为提供了机制性洞察,并为精确的模板层编辑提供了实用工具包。

关键词

引用

@article{arxiv.2604.27401,
  title  = {Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs},
  author = {Hongliang Liu and Tung-Ling Li and Yuhao Wu},
  journal= {arXiv preprint arXiv:2604.27401},
  year   = {2026}
}