中文

CircuitProbe: 通过稳定性区域检测预测 Transformer 中的推理电路

人工智能 2026-04-02 v1 机器学习

摘要

Transformer 语言模型包含局部化的推理电路,即在推理时通过复制可提升推理能力的连续层块。目前寻找这些电路需要暴力搜索,每模型耗费 25 GPU 小时。我们提出 CircuitProbe,它通过激活统计量在 CPU 上不到 5 分钟内预测电路位置,实现了三个到四个数量级的加速。我们发现推理电路有两种类型:通过表示变化导数在早期层检测到的稳定电路,以及通过异常评分在后期层检测到的幅度电路。我们在涵盖 6 种架构的 9 个模型上进行了验证,包括 2025 年模型,确认 CircuitProbe 的 top 预测在所有已验证案例中与最优电路匹配或在 2 层之内。跨 Qwen 2.5 家族的扩展实验表明,层复制对 3B 参数以下的模型持续有益,但会损害 7B+ 模型的性能,使其成为小语言模型的实用扩展技术。CircuitProbe 仅需 10 个校准样本,且其预测在英语、印地语、中文和法语中保持稳定。

关键词

引用

@article{arxiv.2604.00716,
  title  = {CircuitProbe: Predicting Reasoning Circuits in Transformers via Stability Zone Detection},
  author = {Rajkiran Panuganti},
  journal= {arXiv preprint arXiv:2604.00716},
  year   = {2026}
}

备注

11 pages, 1 figure, 3 tables. Code available at https://github.com/agenticclass/circuitprobe