架构决定于规模:大型语言模型中的电路局部化
计算与语言
2026-05-12 v1
摘要
机械可解释性假设随模型规模增大,电路分析变得更加困难。我们挑战这一假设,通过表明注意力架构的重要性超过参数数量。我们研究了Pythia和Qwen2.5跨越三种电路类型的情形,发现分组查询注意力产生的电路在相当规模下远比标准多头注意力更集中且在机制上更稳定。相同的集中模式在间接对象识别、归纳头和事实记忆电路中均成立。在单个架构家族(Qwen2.5)内部,事实记忆电路在临界规模以上发生离散相变,坍缩为单个瓶颈,而非逐渐退化。这些发现表明,某些架构选择使大型模型更易于研究,而模型规模并非解释性难度的固定结果。
引用
@article{arxiv.2605.08853,
title = {Architecture, Not Scale: Circuit Localization in Large Language Models},
author = {Sohan Venkatesh},
journal= {arXiv preprint arXiv:2605.08853},
year = {2026}
}