单位置干预失败:分布式输出模板驱动的零样本学习
摘要
理解大型语言模型如何从零样本演示中编码任务身份是机制可解释性中的核心开放问题。先前的工作使用线性探针来局部化任务表示,报告在特定层的高分类准确率。我们揭示了一种惊人的 dissociate:探针准确率完全无法预测因果重要性。单位置激活干预在Llama-3.2-3B的所有28层实现0%任务迁移——尽管这些位置上达到了100%的探针准确率。这一空结果本身就是一个关键发现,表明任务编码本质上是分布式的。多位置干预——同时替换所有演示输出标记的激活——在第8层实现最高达96%的迁移(N=50, 95%置信区间: [87%, 99%]),首次定位了ICL任务身份的因果位置。我们在跨越三个架构族(LLaMA、Qwen、Gemma)的四个模型中验证了这些发现的普遍性,发现约30%网络深度处存在普遍的干预窗口。因果追踪揭示了一种非对称的架构:查询位置严格必需(53-100%干扰),而没有单个演示位置必需(0%干扰)——解决了先前论述中的关键歧义。关键的是,迁移依赖于内部表示的兼容性,而非表面相似性(r=-0.05 vs r=0.31),排除了平凡解释。这些结果确立了分布式模板假设:ICL任务身份编码为演示标记上分布式的输出格式模板,根本性地重塑了我们对如何操作零样本学习的理解。
引用
@article{arxiv.2605.04061,
title = {Single-Position Intervention Fails: Distributed Output Templates Drive In-Context Learning},
author = {Bryan Cheng and Jasper Zhang},
journal= {arXiv preprint arXiv:2605.04061},
year = {2026}
}
备注
8 pages, 3 figures. Accepted to the 2026 Learning and Intelligent Optimization Conference and workshops on Foundation Models for Science: Real-World Impact and Science-First Design, Latent & Implicit Thinking - Going Beyond CoT Reasoning, Logical Reasoning of Large Language Models at ICLR 2026