寻找隐式规划:通过轻量级机制干预定位语言模型中的潜在规划
机器学习
2026-05-11 v1 人工智能
摘要
我们研究语言模型中的规划位置形成——即在前向传递过程中,结构受限的未来标记内部表征何时形成,以及它们是否因果驱动生成。我们以押韵对完成为清洁的前瞻约束测试,分别在Qwen3、Gemma-3和Llama-3多个规模上应用线性探测和激活修补两种轻量级方法。探测显示,未来押韵信息在行边界处可线性解码,随规模在三个家族中信号均随规模增强。激活修补揭示,只有Gemma-3-27B在这种编码上具有因果依赖,展现出一种在第30层左右从押韵词到行边界的驱动迁移。我们测试的其他每个模型在生成过程中都依赖押韵词,尽管在行边界处探测信号很强,但因果效应几乎为零。我们通过两阶段路径修补将Gemma-3-27B的handoff局部化到五个注意力头,恢复约90%的押韵路由能力在换行处。
引用
@article{arxiv.2605.07984,
title = {Where's the Plan? Locating Latent Planning in Language Models with Lightweight Mechanistic Interventions},
author = {Nicole Ma and Nick Rui},
journal= {arXiv preprint arXiv:2605.07984},
year = {2026}
}
备注
13 pages, 20 figures, 3 tables